Hammustades logistilist regressiooni

Hammustades logistilist regressiooni

Selles artiklis uurime teoreetilisi vĂ€ljundeid, lineaarse regressiooni funktsiooni, ĂŒhes tagasipöörde logistilise transformatsiooni funktsiooni (tuntud ka kui logistilise vastuse funktsioon),seejĂ€rel kasutame maksimaalse tĂ”enĂ€osuse metoodikat, et vastavalt logistilise regressiooni mudelile tuletada kaotuse funktsioon,, vastavalt logistilise regressiooni mudelile, tuletame kaotusefunktsiooni Logistic Loss,vĂ”i teisisĂ”nu mÀÀratleme funktsiooni, mille abil mÀÀritakse logistilise regressiooni mudelis kaaluvektorite parameetrid. Hammustades logistilist regressiooni.

Artikli plaan:

  1. Korrake lineaarse sĂ”ltuvuse ĂŒle kahe muutuja vahel,
  2. tuvastame vajaduse transformatsiooniks, lineaarse regressiooni funktsiooni, Hammustades logistilist regressiooni ĂŒhes logistilise vastuse funktsiooni. Hammustades logistilist regressiooni
  3. Teeme muudatusi ja tuletame, logistilise vastuse funktsiooni.
  4. ĂŒritame aru saada, miks vĂ€ikseima ruudu meetod ei tööta parameetrite mÀÀramiseks, Hammustades logistilist regressiooni funktsioonid Logistic Loss,
  5. Kasutame maksimaalne tÔenÀosusmeetod et mÀÀratleda, parameetrite mÀÀramise funktsiooni. Hammustades logistilist regressiooni:

    5.1. Juhtum 1: funktsioon Logistic Loss, klasside mÀrgenditud objektide jaoks, 0 ja 1:

    Hammustades logistilist regressiooni

    5.2. Juhtum 2: funktsioon. Logistic Loss, klasside mÀrgenditud objektide jaoks, -1 ja +1:

    Hammustades logistilist regressiooni


Artikkel on tĂ€is lihtsaid nĂ€iteid, kus kĂ”ik arvutused on kergesti teostatavad suuliselt vĂ”i paberil, mĂ”nel juhul vĂ”ib osutuda vajalikuks kalkulaator. Nii et valmistuge 🙂

See artikkel on suunatud peamiselt algtaseme andeteadlastele, kellel on pÔhilised teadmised masinÔppe alustest.

Artiklis on ka kood jooniste joonistamiseks ja arvutusteks. Kogu kood on kirjutatud keeles, python 2.7eelnevalt selgitan, mis on „uuenduslikus” versioonis – see on ĂŒks tingimusi, et tĂ€iendada tuntud kursust, Yandexist, ĂŒhel kuulsamal internetialust. CourseraNagu jĂ€reldada vĂ”ib, on materjal koostatud selle kursuse alusel.

01. Lineaarne sÔltuvus

On tĂ€iesti loogiline esitada kĂŒsimus – kuidas seondub lineaarne sĂ”ltuvus logistilise regressiooniga?

KĂ”ik on lihtne! Logistiline regressioon on ĂŒks mudel, mis kuulub lineaarsete klassifikatorite hulka. Lihtsustatult öeldes on lineaarse klassifikaatori ĂŒlesanne ennustada sihtvÀÀrtuste vÀÀrtusi Hammustades logistilist regressiooni muutujatest (regressoritest), Hammustades logistilist regressioonisamal ajal oletatakse, et seos tunnuste ja sihivÀÀrtuste vahel on lineaarne. Sealt ka klassifikaatori nimi – lineaarne. Kui vĂ€ga lihtsalt kokku vĂ”tta, siis logistilise regressiooni mudeli aluseks on eeldus, et tunnuste vahel on lineaarne seos. Hammustades logistilist regressiooni ja sihttulemustele Hammustades logistilist regressiooni See on seos. Hammustades logistilist regressiooni ja sihttulemustele Hammustades logistilist regressiooniSiin on esimene nĂ€ide ja see on Ă”igesti lineaarse sĂ”ltuvuse uuritavatest suurustest. Artikli ettevalmistamise protsessis sattusin nĂ€iteks, mis on paljudele tuttav – voolu sĂ”ltuvus pinge suhtes,

Stuudios on esimene nĂ€ide, ja see on, Ă”igesti, sirge seos uuritavate suurustega. Artikli ettevalmistamise kĂ€igus komistasin nĂ€ite peale, mis on juba paljudele tuttav — voolu sĂ”ltuvus pingest („Rakenduslik regressioonianalĂŒĂŒs”, N. Draper, G. Smith),mida me siin samuti arutame.

Vastavalt Ohmi seaduse kohaselt:

Hammustades logistilist regressiooni, kus Hammustades logistilist regressiooni — vool, Hammustades logistilist regressiooni — pinge, Hammustades logistilist regressiooni — takistus.

Kui me ei teaks, Ohmi seadust,siis vĂ”iksime sĂ”ltuvust leidma hakata empiiriliselt, muutes Hammustades logistilist regressiooni ja mÔÔtes, Hammustades logistilist regressioonihoides samas Hammustades logistilist regressiooni fikseeritud. Siis nĂ€eksime, et sĂ”ltuvuse graafik Hammustades logistilist regressiooni alates Hammustades logistilist regressiooni annab rohkem vĂ”i vĂ€hem sirge joone, mis lĂ€bib koordinaatide alguspunkti. Me ĂŒtlesime „rohkem vĂ”i vĂ€hem”, kuna kuigi sĂ”ltuvus on sisuliselt tĂ€pne, vĂ”ivad meie mÔÔtmised sisaldada vĂ€ikseid vigu ja seepĂ€rast ei pruugi graafikul olevad punktid rangelt joonele jÀÀda, vaid vĂ”ivad ringelda selle ĂŒmber juhuslikult.

Graafik 1 «SÔltuvus, Hammustades logistilist regressiooni alates Hammustades logistilist regressiooni»

Hammustades logistilist regressiooni

graafiku joonistamise kood:

import matplotlib.pyplot as plt
%matplotlib inline

import numpy as np

import random

R = 13.75

x_line = np.arange(0,220,1)
y_line = []
for i in x_line:
    y_line.append(i/R)
    
y_dot = []
for i in y_line:
    y_dot.append(i+random.uniform(-0.9,0.9))


fig, axes = plt.subplots(figsize = (14,6), dpi = 80)
plt.plot(x_line,y_line,color = 'purple',lw = 3, label = 'I = U/R')
plt.scatter(x_line,y_dot,color = 'red', label = 'Tegelikud tulemused')
plt.xlabel('I', size = 16)
plt.ylabel('U', size = 16)
plt.legend(prop = {'size': 14})
plt.show()

02. Lineaarse regressiooni vÔrrandi transformatsioonide vajadus

Vaatame jĂ€rgnevat nĂ€idet. Oletame, et töötame pangas ja meil on ĂŒlesanne mÀÀrata laenu tagasimaksmise tĂ”enĂ€osus laenaja poolt sĂ”ltuvalt mĂ”nest tegurist. Lihtsustamiseks arutame ainult kahte tegurit: laenaja kuupalk ja kuumakse laenu tagasimaksmiseks.

Ülesanne on vĂ€ga tingimuslik, kuid selle nĂ€ite kaudu saame aru, miks selle lahendamiseks ei ole piisav ainult lineaarse regressiooni funktsiooni,, ning saame teada, milliseid muudatusi on funktsioonis vaja teha.

Naas tagasi nĂ€ite juurde. Arusaadav on, et mida kĂ”rgem on palk, seda rohkem suudab laenuvĂ”tja igakuiselt oma laenumakseteks suunata. Sellegipoolest on teatud palgavahemikus see seos ĂŒsna lineaarne. NĂ€iteks vĂ”ttes palga vahemiku 60.000 R kuni 200.000 R, oletame, et antud palga vahemikus on igakuise makse ja palga vaheline seos lineaarne. Oletame, et antud palga suuruse vahemikus on tuvastatud, et palga ja makse suhe ei tohi olla alla 3 ja laenuvĂ”tjale peab jÀÀma ĂŒle 5.000 R. Ainult sel juhul peame me laenuvĂ”tjat krediidi tagasimaksmiseks sobivaks. Seega vĂ”tab lineaarse regressiooni vĂ”rrand jĂ€rgmise kuju:

Hammustades logistilist regressiooni

kus Hammustades logistilist regressiooni, Hammustades logistilist regressiooni, Hammustades logistilist regressiooni, Hammustades logistilist regressiooni — palk Hammustades logistilist regressiooni-e laenuvĂ”tja, Hammustades logistilist regressiooni — laenu makse Hammustades logistilist regressiooni-e laenuvĂ”tja.

Asendades vÔrrandisse palga ja laenu makse fikseeritud parameetritega Hammustades logistilist regressiooni saab teha otsuse laenu andmise vÔi keeldumise kohta.

JĂ€tkates, mĂ€rkime, et antud parameetrite juures Hammustades logistilist regressiooni lineaarse regressiooni funktsioon, mida kasutatakse logistilise vastuse funktsioonis annab suurendatud vÀÀrtusi, mis raskendavad laenu tagasimaksmise tĂ”enĂ€osuste arvutamist. SeetĂ”ttu soovitame meie koefitsiente vĂ€hendada, ĂŒtleme, 25.000 korda. Sellest muundamisest koefitsientides ei muutu meie otsus laenu andmise osas. Peame selle hetke meeles tulevikus, ja et oleks veel arusaadavam, millest jutt, vaatame kolme potentsiaalset laenuvĂ”tjat.

Tabel 1 „Potentsiaalsed laenuvĂ”tjad“

Hammustades logistilist regressiooni

Kood tabeli genereerimiseks

import pandas as pd

r = 25000.0
w_0 = -5000.0/r
w_1 = 1.0/r
w_2 = -3.0/r

data = {'LaenuvÔtja':np.array(['Vasya', 'Fedya', 'Lesha']), 
        'Palk':np.array([120000,180000,210000]),
       'Makse':np.array([3000,50000,70000])}

df = pd.DataFrame(data)

df['f(w,x)'] = w_0 + df['Palk']*w_1 + df['Makse']*w_2

decision = []
for i in df['f(w,x)']:
    if i > 0:
        dec = 'Heakskiidetud'
        decision.append(dec)
    else:
        dec = 'Keeldumine'
        decision.append(dec)
        
df['Otsus'] = decision

df[['LaenuvÔtja', 'Palk', 'Makse', 'f(w,x)', 'Otsus']]

Tabeli andmete kohaselt soovib Vasja, kelle palk on 120.000 R, saada sellist laenu, et igakuine makse oleks 3.000 R. Oleme kindlaks teinud, et laenu heakskiitmiseks peab Vasja palk ĂŒletama kolm korda laenumakset ja tal peab olema veel 5.000 R. Sellele nĂ”udele vastab Vasja: Hammustades logistilist regressiooni. Isegi jÀÀb 106.000 R. Kuigi me arvutuses Hammustades logistilist regressiooni oleme koefitsiente vĂ€hendanud Hammustades logistilist regressiooni 25.000 korda, saime ikka sama tulemuse — laen vĂ”ib olla heaks kiidetud. Ka Fedya saab laenu, kuid Leshal, kuigi tal on kĂ”rgeim palk, tuleb oma soovid tagasi hoida.

Joonistame sellisel juhul graafiku.

Joon 2 „LaenuvĂ”tjate klassifitseerimine“

Hammustades logistilist regressiooni

Kood graafiku joonistamiseks

salary = np.arange(60000,240000,20000)
payment = (-w_0-w_1*salary)/w_2


fig, axes = plt.subplots(figsize = (14,6), dpi = 80)
plt.plot(salary, payment, color = 'grey', lw = 2, label = '$f(w,x_i)=w_0 + w_1x_{i1} + w_2x_{i2}$')
plt.plot(df[df['Otsus'] == 'Heakskiidetud']['Palk'], df[df['Otsus'] == 'Heakskiidetud']['Makse'], 
         'o', color ='green', markersize = 12, label = 'Otsus - Laen heaks kiidetud')
plt.plot(df[df['Otsus'] == 'Keeldumine']['Palk'], df[df['Otsus'] == 'Keeldumine']['Makse'], 
         's', color = 'red', markersize = 12, label = 'Otsus - Laenu keeldumine')
plt.xlabel('Palk', size = 16)
plt.ylabel('Makse', size = 16)
plt.legend(prop = {'size': 14})
plt.show()

Nii, meie sirge, mis on joonistatud vastavalt funktsioonile Hammustades logistilist regressiooni, eraldab "halvad" laenuvĂ”tjad "headest". Need laenuvĂ”tjad, kelle soovid ei vasta vĂ”imalustele, on sirgest ĂŒleval (Lesha), need, kes suudavad vastavalt meie mudeli parameetritele laenu tagasi maksta, on allpool sirget (Vasya ja Fedya). Teisi sĂ”nu — meie sirge jagab laenuvĂ”tjad kaheks klassiks. MÀÀratleme need jĂ€rgmiselt: klassi Hammustades logistilist regressiooni arvame, et need laenuvĂ”tjad, kes tĂ”enĂ€oliselt tagastavad laenu, ning klassi Hammustades logistilist regressiooni vĂ”i Hammustades logistilist regressiooni arvame, et need laenuvĂ”tjad, kes tĂ”enĂ€oliselt ei suuda laenu tagasi maksta.

KokkuvÔtame jÀreldused sellest lihtsast nÀitest. VÔtame punkti Hammustades logistilist regressiooni ja asendades punkti koordinaadid vastavasse sirge vÔrrandisse Hammustades logistilist regressiooni, vaatame kolme varianti:

  1. Kui punkt asub sirgest allpool ning me seame ta klassi Hammustades logistilist regressiooni, siis funktsiooni vÀÀrtus Hammustades logistilist regressiooni on positiivne punkti. Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooniSeega vÔime arvata, et laenu tagasimaksmise tÔenÀosus jÀÀb vahemikku Hammustades logistilist regressiooni. Mida suurem on funktsiooni vÀÀrtus, seda kÔrgem on tÔenÀosus.
  2. Kui punkt asub sirgest ĂŒleval ja me seame ta klassi Hammustades logistilist regressiooni vĂ”i Hammustades logistilist regressiooni, siis funktsiooni vÀÀrtus on negatiivne punkti. Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooniSiis arvame, et laenu tagasimaksmise tĂ”enĂ€osus on vahemikus Hammustades logistilist regressiooni ja, mida suurem on funktsiooni vÀÀrtuse absoluutne vÀÀrtus, seda kĂ”rgem on meie kindel uskumus.
  3. Punkt asub sirgel, kahe klassi piiril. Sellisel juhul funktsiooni vÀÀrtus Hammustades logistilist regressiooni on vÔrdne Hammustades logistilist regressiooni ja laenu tagasimaksmise tÔenÀosus on Hammustades logistilist regressiooni.

NĂŒĂŒd kujutame ette, et meil pole kaht tegurit, vaid kĂŒmneid, laenuvĂ”tjaid on mitte kolm, vaid tuhandeid. Siis on meil sirge asemel m-mÔÔtmelise tasandi ja koefitsiendid Hammustades logistilist regressiooni meie andmed ei tule lihtsalt nii öeldes, vaid need on saadud kĂ”igi reeglite kohaselt, tuginedes kogunenud andmetele laenuvĂ”tjate kohta, kes on laenu tagasi maksnud vĂ”i mitte. TĂ”epoolest, mĂ€rgake, et me praegu valime laenuvĂ”tjaid juba teadaolevate koefitsientide pĂ”hjal. Hammustades logistilist regressiooniTegelikult seisneb logistilise regressiooni mudeli ĂŒlesanne just selles, et mÀÀrata parameetrid, Hammustades logistilist regressiooni, mille korral kahjumi funktsiooni vÀÀrtus Logistic Loss, pĂŒĂŒab minimaalsele lĂ€heneda. Kuid kuidas vektorit Hammustades logistilist regressiooni, me Ă”pime alles artikli 5. osas. Seni suundume tagasi lubatud maale — meie panganduse ja kolme kliendi juurde.

TĂ€nu funktsioonile Hammustades logistilist regressiooni me teame, kellele saab laenu anda, ja kellele tuleks keelduda. Kuid selliste andmetega ei saa direktorile minna, kuna nad soovisid saada tĂ”enĂ€osust, et iga laenuvĂ”tja maksab laenu tagasi. Mida teha? Vastus on lihtne — me peame kuidagi muutma funktsiooni Hammustades logistilist regressiooni, mille vÀÀrtused jÀÀvad vahemikku Hammustades logistilist regressiooni funktsiooniks, mille vÀÀrtused jÀÀvad vahemikku Hammustades logistilist regressiooni. Ja selline funktsioon eksisteerib, seda nimetatakse logistilise vastuse funktsiooniks vĂ”i vastupidiseks logit-muundamiseks.Tutvuge:

Hammustades logistilist regressiooni

Vaadakem samm-sammult, kuidas saame logistilise vastuse funktsiooni.MĂ€rka, et me liigume vastupidises suunas, st me eeldame, et me teame tĂ”enĂ€osuse vÀÀrtust, mis jÀÀb vahemikku Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooni ja seejĂ€rel „arendame” seda vÀÀrtust kogu arvude ulatuses alates Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooni.

03. Saame logistilise vastuse funktsiooni.

Samm 1. Muudame tÔenÀosuse vÀÀrtused vahemikku Hammustades logistilist regressiooni

Kunstlik transformatsioonifunktsiooni ajal jĂ€tame meie krediidianalĂŒĂŒtiku rahule ja selle asemel kĂŒlastame spordiennustuskontoreid. Ei, muidugi me ei hakka panuseid tegema, kĂ”ik, mis meid seal huvitab, on vĂ€ljend, nĂ€iteks „vĂ”imalus 4:1”. VĂ”imalused, millega kĂ”ik panustajad tuttavad, on „edukate” ja „ebaedukate” suhe. TĂ”enĂ€osuste osas on vĂ”imalused sĂŒndmuse toimumise tĂ”enĂ€osus jagatud ebaĂ”nnestumise tĂ”enĂ€osusega. Kirjutame sĂŒndmuse toimumise vĂ”imaluse valemi Hammustades logistilist regressiooni ĂŒhes logistilise vastuse funktsiooni. Hammustades logistilist regressiooni — sĂŒndmuse toimumise tĂ”enĂ€osus, Hammustades logistilist regressiooni:

Hammustades logistilist regressiooni

, kus Hammustades logistilist regressiooni — sĂŒndmuse mitte toimumise tĂ”enĂ€osus. Hammustades logistilist regressiooni NĂ€iteks, kui tĂ”enĂ€osus, et noor, tugev ja energiline hobune nimega „Tuuleke” ĂŒletab derbihobust nimega „Matilda”, on

, siis „Tuuleke” eduvĂ”imalused on Hammustades logistilist regressiooni, ja vastupidi, teades vĂ”imalusi, pole meil raske arvutada tĂ”enĂ€osust. Hammustades logistilist regressiooni kellele Hammustades logistilist regressiooni Hammustades logistilist regressiooni Seega oleme Ă”ppinud „tĂ”lkima” tĂ”enĂ€osust vĂ”imalusteks, mille vÀÀrtused jÀÀvad vahemikku. Hammustades logistilist regressiooni:

Hammustades logistilist regressiooni

Teeme veel ĂŒhe sammu ja Ă”pime „tĂ”lkima” tĂ”enĂ€osust kogu numbrilisel sirgel alates Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooniSamm 2. Muudame tĂ”enĂ€osuse vÀÀrtused vahemikku Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooni.

See samm on vĂ€ga lihtne — arvestame vĂ”imalusi Euler’i numbri alusel Hammustades logistilist regressiooni

ja saame: Hammustades logistilist regressiooni NĂŒĂŒd teame, et kui

Hammustades logistilist regressiooni

, siis vÀÀrtuse arvutamine Hammustades logistilist regressioonion vÀga lihtne ja, rohkem veel, see peab olema positiivne: Hammustades logistilist regressiooni . Nii ongi. Hammustades logistilist regressiooniHuvitav kontrollime, et kui

, siis ootame, et nĂ€ha negatiivset vÀÀrtust. Hammustades logistilist regressiooniKontrollime: Hammustades logistilist regressiooni. KĂ”ik on Ă”ige. Hammustades logistilist regressiooniNĂŒĂŒd teame, kuidas tĂ”lkida tĂ”enĂ€osuse vÀÀrtus alates

kogu numbrilisel sirgel alates Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooni . JÀrgmises etapis teeme kÔik vastupidi. Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooniJa seni mÀrkime, et logaritmi reeglite kohaselt, teadmine funktsiooni vÀÀrtusest

, saab arvutada vÔimalused: Hammustades logistilist regressiooniSee meetod vÔimaluste mÀÀramiseks on meile kasulik jÀrgmisel sammul.

Hammustades logistilist regressiooni

Samm 3. Saame valemi vÀlja töötamiseks

Nii oleme Ôppinud, teades Hammustades logistilist regressiooni

, leidma funktsiooni vÀÀrtused. Hammustades logistilist regressiooniKuid tegelikult vajame me kĂ”ike vastupidi — teades vÀÀrtust Hammustades logistilist regressioonileida Hammustades logistilist regressiooni . Selleks viime sisse mĂ”iste vastupidine vĂ”imaluste funktsioon, mille kohaselt: Hammustades logistilist regressiooniSelles artiklis me ei hakka vĂ€ljatoodud valemit tuletama, kuid kontrollime numbrite pĂ”hjal, mis on eespool. Teame, et 4:1 vĂ”imaluste korral (

Hammustades logistilist regressiooni

) on sĂŒndmuse toimumise tĂ”enĂ€osus 0.8 (Hammustades logistilist regressiooni). Teeme asenduse:Hammustades logistilist regressiooni. See vastab meie varasemate arvutuste tulemustele. Liigume edasi. Hammustades logistilist regressiooniEelmises etapis leidis, et

, seega saab teha asenduse vastupidises vĂ”imaluste funktsioonis. Saame: Hammustades logistilist regressiooniNĂŒĂŒd jagame nii nimetaja kui ka lugeja

Hammustades logistilist regressiooni

, seega: Hammustades logistilist regressiooniSelleks, et olla ettevaatlik, et mitte kuskil viga teha, teeme veel ĂŒhe vĂ€ikese kontrolli. Teises etapis mÀÀrasime, et

Hammustades logistilist regressiooni

on. Hammustades logistilist regressiooni SeejÀrel, asendades vÀÀrtuse Hammustades logistilist regressioonilogistilise vastuse funktsioonis, ootame, et saada Hammustades logistilist regressiooni . Asendame ja saame: Hammustades logistilist regressiooniPalju Ônne teile, kallis lugeja, me oleme just vÀlja töötanud ja katsetanud logistilise vastuse funktsiooni. Vaadake graafikut. Hammustades logistilist regressiooni

Graafik 3 «Logistilise vastuse funktsioon»

Graafik 3 „Logistilise reaktsiooni funktsioon“

Hammustades logistilist regressiooni

Kood graafiku joonistamiseks

import math

def logit (f):
    return 1/(1+math.exp(-f))

f = np.arange(-7,7,0.05)
p = []

for i in f:
    p.append(logit(i))

fig, axes = plt.subplots(figsize = (14,6), dpi = 80)
plt.plot(f, p, color = 'grey', label = '$ 1 / (1+e^{-w^Tx_i})$')
plt.xlabel('$f(w,x_i) = w^Tx_i$', size = 16)
plt.ylabel('$p_{i+}$', size = 16)
plt.legend(prop = {'size': 14})
plt.show()

KÀesolevas kirjanduses vÔib leida ka selle funktsiooni nimetust kui sigmoidi funktsioon. Graafikult on selgelt nÀha, et objekti kuuluvuse tÔenÀosus klassi muutub oluliselt suhteliselt kitsas vahemikus Hammustades logistilist regressiooni, kuskil Hammustades logistilist regressiooni kuni Hammustades logistilist regressiooni.

Soovitan naasta meie krediidianalĂŒĂŒtiku juurde ja aidata tal arvutada laenu tagasi maksmise tĂ”enĂ€osust, vastasel juhul riskib ta preemia kaotamisega 🙂

Tabel 2 „Potentsiaalsed laenajad“

Hammustades logistilist regressiooni

Kood tabeli genereerimiseks

proba = []
for i in df['f(w,x)']:
    proba.append(round(logit(i),2))
    
df['TÔenÀosus'] = proba

df[['Laenaja', 'Palganumber', 'Makse', 'f(w,x)', 'Otsus', 'TÔenÀosus']]

Nii et oleme mÀÀranud laenu tagasimaksmise tĂ”enĂ€osuse. Üldiselt nĂ€ib see olevat tĂ”ele lĂ€hedane.

TĂ”epoolest, tĂ”enĂ€osus, et Vassil, kelle palk on 120 000 R, suudab igakuiselt pankadele maksta 3 000 R, on lĂ€hedane 100%-le. Pealegi peame arvestama, et pank vĂ”ib anda laenu ka LeĆĄale, juhul kui panga poliitika nĂ€eb ette, et laenatakse kliente, kelle tagasimakse tĂ”enĂ€osus ĂŒletab nĂ€iteks 0.3. Sel juhul moodustab pank suurema reservi vĂ”imalike kaotuste katmiseks.

Samuti tuleb mÀrkida, et palga ja makse suhe vÀhemalt 3 ja 5 000 R varuga on valitud meelevaldselt. Seega ei saanud me mingil juhul kasutada algselt mÀÀratud kaaluvektorit Hammustades logistilist regressiooni. Me pidime proportsioone mÀrgatavalt vÀhendama ning selle tulemuseks jagasime iga koefitsiendi 25 000-ga, see tÀhendab, et me kohandasime tulemuse. Kuid see tehti teadlikult, et lihtsustada materjali mÔistmist alguses. Elus ei peaks me mitte koefitsiente vÀlja mÔtlema ja kohandama, vaid neid leidma. Juba jÀrgmistes artikli osades tuletame vÀlja valemid, mille abil koefitsiendid mÀÀratakse Hammustades logistilist regressiooni.

04. VÀhemate ruutude meetod kaaluvektori mÀÀramisel Hammustades logistilist regressiooni logistilise vastuse funktsioonis

Niisiis on meil juba teada, et selline kaaluvektori mÀÀramise meetod Hammustades logistilist regressiooni, nagu vĂ€hemate ruutude meetod (VRM) ja miks me siis ei vĂ”iks seda kasutada binaarsetes klassifitseerimisĂŒlesannetes? TĂ”epoolest, miski ei takista meie kasutamist MNLK, kuid see meetod annab klassifitseerimisel vĂ€hem tĂ€pseid tulemusi kui Logistic Loss,. Sellel on teoreetiline alus. Alustame ĂŒhe lihtsa nĂ€itega.

Oletame, et meie mudelid (mida kasutame MSE ja Logistic Loss,) on juba alustanud kaaluvektori mÀÀramist Hammustades logistilist regressiooni ja me peatasime arvutuse mingil sammul. Ainult, et ei ole tĂ€htis, kas keskel, lĂ”pus vĂ”i alguses, peamine on see, et meil on juba olemas mĂ”ningad kaaluvektorite vÀÀrtused ja oletame, et sel sammul, kaaluvektorid Hammustades logistilist regressiooni mĂ”lema mudeli jaoks ei erine. Siis vĂ”tame saadud kaalud ja asetame need logistilise vastuse funktsiooni. (Hammustades logistilist regressiooni) mingisuguse objekti jaoks, mis kuulub klassi Hammustades logistilist regressiooni. Uurime kahte juhtumit, kui meie mudel, mis pĂ”hineb mÀÀratud kaaluvektoril, eksib tugevalt ja vastupidi — mudel on kindel, et objekt kuulub klassi Hammustades logistilist regressiooni. Vaadakem, millised karistused oleksid "vĂ€lja antud" kasutades MNLK ja Logistic Loss,.

Karistuste arvutamise kood sÔltuvalt kasutatavast kaotuse funktsioonist

# Đșласс ĐŸĐ±ŃŠĐ”Đșта
y = 1
# ĐČĐ”Ń€ĐŸŃŃ‚ĐœĐŸŃŃ‚ŃŒ ĐŸŃ‚ĐœĐ”ŃĐ”ĐœĐžŃ ĐŸĐ±ŃŠĐ”Đșта Đș Đșлассу ĐČ ŃĐŸĐŸŃ‚ĐČДтстĐČОО с ĐżĐ°Ń€Đ°ĐŒĐ”Ń‚Ń€Đ°ĐŒĐž w
proba_1 = 0.01

MSE_1 = (y - proba_1)**2
print 'йтраф MSE про ĐłŃ€ŃƒĐ±ĐŸĐč ĐŸŃˆĐžĐ±ĐșĐ” =', MSE_1

# ĐœĐ°ĐżĐžŃˆĐ”ĐŒ Ń„ŃƒĐœĐșцою ĐŽĐ»Ń ĐČŃ‹Ń‡ĐžŃĐ»Đ”ĐœĐžŃ f(w,x) про ОзĐČĐ”ŃŃ‚ĐœĐŸĐč ĐČĐ”Ń€ĐŸŃŃ‚ĐœĐŸŃŃ‚Đž ĐŸŃ‚ĐœĐ”ŃĐ”ĐœĐžŃ ĐŸĐ±ŃŠĐ”Đșта Đș Đșлассу +1 (f(w,x)=ln(odds+))
def f_w_x(proba):
    return math.log(proba/(1-proba)) 

LogLoss_1 = math.log(1+math.exp(-y*f_w_x(proba_1)))
print 'йтраф Log Loss про ĐłŃ€ŃƒĐ±ĐŸĐč ĐŸŃˆĐžĐ±ĐșĐ” =', LogLoss_1

proba_2 = 0.99

MSE_2 = (y - proba_2)**2
LogLoss_2 = math.log(1+math.exp(-y*f_w_x(proba_2)))

print '**************************************************************'
print 'йтраф MSE про ŃĐžĐ»ŃŒĐœĐŸĐč уĐČĐ”Ń€Đ”ĐœĐœĐŸŃŃ‚Đž =', MSE_2
print 'йтраф Log Loss про ŃĐžĐ»ŃŒĐœĐŸĐč уĐČĐ”Ń€Đ”ĐœĐœĐŸŃŃ‚Đž =', LogLoss_2

Juhul jĂ€medast veast — mudel mÀÀrab objekti klassi Hammustades logistilist regressiooni tĂ”enĂ€osusega 0,01

Karistus kasutades MNLK koosneb:
Hammustades logistilist regressiooni

Karistus kasutades Logistic Loss, koosneb:
Hammustades logistilist regressiooni

Juhul tugeva enesekindluse korral — mudel mÀÀrab objekti klassi Hammustades logistilist regressiooni tĂ”enĂ€osusega 0,99

Karistus kasutades MNLK koosneb:
Hammustades logistilist regressiooni

Karistus kasutades Logistic Loss, koosneb:
Hammustades logistilist regressiooni

See nĂ€ide illustreerib hĂ€sti, et jĂ€meda vea korral karistusfunktsioon Log Loss karistab mudelit oluliselt rohkem kui MSE. NĂŒĂŒd lahendame, millised on teoreetilised eeldused kaotuse funktsiooni kasutamiseks Log Loss klassifitseerimisĂŒlesannetes.

05. Maksimaalse tÔenÀosuse meetod ja logistiline regressioon

Nagu lubatud alguses, sisaldab artikkel palju lihtsaid nĂ€iteid. Ateljees on jĂ€rjekordne nĂ€ide ja vanad kĂŒlalised — panga laenuvĂ”tjad: Vassja, Fedja ja LeĆĄa.

Igaks juhuks, enne nĂ€ite arendamist, meenutan, et elus tegeleme Ă”ppimisvalimitega, kus on tuhandeid vĂ”i miljoneid objekte ning kĂŒmneid vĂ”i sadu tunnuseid. Siiski on numbrid siin valitud selliselt, et need mahuksid kergesti algaja andmete teadlase pĂ€he.

Naasime tagasi nĂ€ite juurde. Kujutame ette, et panga direktor otsustas anda laenu kĂ”igile vajajatele, hoolimata sellest, et algoritm soovitas mitte anda laenu Ljale. Ja siis on möödunud piisavalt aega ning saame teada, kes kolmest kangelasest on laenu tagasi maksnud ja kes ei. Nagu oodata vĂ”is: Vassil ja Fedjal Ă”nnestus laen tagasi maksta, kuid Ljale ei Ă”nnestunud. NĂŒĂŒd kujutame ette, et see tulemus on meie jaoks uus Ă”pikogum ja samas on nagu kadunud kĂ”ik andmed, mis mĂ”jutavad laenu tagasi maksmise tĂ”enĂ€osust (laenuvĂ”tja palk, igakuise makse suurus). Seega vĂ”ime intuitiivselt arvata, et iga kolmas laenuvĂ”tja ei tagasta panka laenu, teisisĂ”nu, tĂ”enĂ€osus, et jĂ€rgmine laenuvĂ”tja laenu tagasi maksab, on Hammustades logistilist regressiooni. Sellele intuitiivsele oletusele on teoreetiline tĂ”estus, mis pĂ”hineb maksimaalse tĂ”enĂ€osuse meetodil, mida sageli nimetatakse maksimaalse tĂ”enĂ€osuse printsiibiks.

Alustuseks tutvume mÔisted.

Valimi tÔenÀosus on tÔenÀosus, et saame just sellise valimi ja just sellised vaatlus-/tulemused, s.t. iga tulemuse tÔenÀosuste korrutis (nÀiteks Vassi, Fedja ja Lja laenu tagasimaksmine vÔi mitte).

TÔenÀosuse funktsioon seob valimi tÔenÀosuse ja jaotuse parameetrite vÀÀrtused.

Meie puhul kujutab vĂ€ljaĂ”ppe valim endast ĂŒldistatud Bernoulli skeemi, kus juhuslik suhe vĂ”tab ainult kaks vÀÀrtust: Hammustades logistilist regressiooni vĂ”i Hammustades logistilist regressiooni. Seega saab valimi tĂ”enĂ€osust kirjutada kui tĂ”enĂ€osuse funktsiooni parameetri Hammustades logistilist regressiooni jĂ€rgmiselt:

Hammustades logistilist regressiooni
Hammustades logistilist regressiooni

Ülaltoodud vĂ€ljendit vĂ”ib tĂ”lgendada jĂ€rgmiselt. Kuigi Vassil ja Fedjal on laenud tagastatud, on tĂ”enĂ€osus, et Lja EI tagasta laenu, Hammustades logistilist regressiooni(kuna toimus just EI tagastamine), seega on kolme sĂŒndmuse ĂŒhine tĂ”enĂ€osus Hammustades logistilist regressiooni (kuna juhtus, et laenu ei tasutud), seega on kolme sĂŒndmuse ĂŒhine tĂ”enĂ€osus vĂ”rdne Hammustades logistilist regressiooni.

Maksimaalne tÔenÀosusmeetod on parameetri hindamise meetod, mille kÀigus maksimeeritakse tÔenÀosusfunktsiooni. Meie puhul peab leidma sellise vÀÀrtuse Hammustades logistilist regressiooni, kus Hammustades logistilist regressiooni saab maksimumi.

Kust siis, mĂ”te – otsida teadmata parameetri vÀÀrtust, mille juures tĂ”enĂ€osuse funktsioon saavutab maksimumi? Idee pĂ€rineb arusaamast, et valim on ainus, meile ligipÀÀsetav teadmisallikas populatsiooni kohta. KĂ”ik, mida me teame populatsioonist, on esitatud valimis. Seega saame öelda, et valim on kĂ”ige tĂ€psem peegeldus populatsioonist, mis on meile kergesti kĂ€tte saadav. SeetĂ”ttu peame leidma parameetri, mille juures on olemasolev valim kĂ”ige tĂ”enĂ€olisem.

Ilmselgelt on meil tegemist optimeerimisĂŒlesandega, kus peame leidma funktsiooni ÀÀrmuspunkti. ÄÀrmuspunkti leidmiseks tuleb kaaluda esimese jĂ€rgu tingimust, s.t. seada funktsiooni derivaat nulliks ja lahendada vĂ”rrand otsitava parameetri osas. Siiski, paljude tegurite derivaadi leidmine vĂ”ib osutuda tĂŒlikaks, et vĂ€ltida seda, on olemas eritehnika - logaritmile ĂŒleminek tĂ”enĂ€osusfunktsiooni. Miks on selline ĂŒleminek vĂ”imalik? Pöörake tĂ€helepanu sellele, et me ei otsi funktsiooni ÀÀrmustHammustades logistilist regressiooni, vaid ÀÀrmuspunkti, ehk vÀÀrtust, mille juures teadmata parameeter Hammustades logistilist regressiooni, kus Hammustades logistilist regressiooni saab maksimumi. Logaritmile ĂŒleminekul ÀÀrmuspunkt ei muutu (kuigi funksioon ise muutub). Logaritm on monotoonne funktsioon.

JĂ€tkame seetĂ”ttu ĂŒlaltoodud kohas esitatud laenude nĂ€ite arendamist. Esiteks liikume tĂ”enĂ€osuse funktsiooni logaritmile:

Hammustades logistilist regressiooni

NĂŒĂŒd saame hĂ”lpsasti tuletada vĂ€ljendit Hammustades logistilist regressiooni:

Hammustades logistilist regressiooni

Ja lÔpuks vaatame esimese jÀrgu tingimust - seame funktsiooni tuletise nulliks:

Hammustades logistilist regressiooni

Seega on meie intuitiivne hinnang laenu tagastamise tÔenÀosusele Hammustades logistilist regressiooni olnud teoreetiliselt pÔhjendatud.

Olej hĂ€sti, kuid mida me nĂŒĂŒd sellise infoga teeme? Kui arvame, et iga kolmas laenuvĂ”tja ei tagasta panka raha, siis viimane jÀÀb kindlasti pankrotti. Nii on see, kuid kui hindame laenu tagastamise tĂ”enĂ€osust vÀÀrtusega Hammustades logistilist regressiooni , ei ole me arvesse vĂ”tnud tegureid, mis mĂ”jutavad laenu tagastamist: laenuvĂ”tja palk ja igakuise makse suurus. Tuletagem meelde, et varem arvutasime laenu tagastamise tĂ”enĂ€osust iga kliendi jaoks, arvestades neid tegureid. On loogiline, et ka meie tĂ”enĂ€osused on saadud erinevad kui konstant, mis on Hammustades logistilist regressiooni.

MÀÀratlegem valimite tÔenÀosus:

Kood tÔenÀosuste arvutamiseks

functools'i kaupa importimine

def tÔenÀosus(y,p):
    rea_tÔenÀosus = []
    for i in range(len(y)):
        ltp_i = p[i]**y[i]*(1-p[i])**(1-y[i])
        rea_tÔenÀosus.append(ltp_i)
    tÔenÀosus = []
    return reduce(lambda a, b: a*b, rea_tÔenÀosus)
        
    y = [1.0,1.0,0.0]
p_log_response = df['Probability']
const = 2.0/3.0
p_const = [const, const, const]


print 'Valim tÔenÀosus konstantsel vÀÀrtusel p=2/3:', round(tÔenÀosus(y,p_const),3)

print '****************************************************************************************************'

print 'Valim tÔenÀosus arvutatud vÀÀrtusel p:', round(tÔenÀosus(y,p_log_response),3)

Valim tÔenÀosus konstantsel vÀÀrtusel Hammustades logistilist regressiooni:

Hammustades logistilist regressiooni

Valim tÔenÀosus, kui arvestada krediidi tagasimaksmise tÔenÀosust teguritega Hammustades logistilist regressiooni:

Hammustades logistilist regressiooni
Hammustades logistilist regressiooni

Valim tĂ”enĂ€osus, mille tĂ”enĂ€osus arvutati sĂ”ltuvalt teguritest, on suurem kui tĂ”enĂ€osus konstantsel vÀÀrtusel. Mida see tĂ€hendab? See tĂ€hendab, et teadmised teguritest vĂ”imaldasid tĂ€psemini mÀÀrata krediidi tagasimaksmise tĂ”enĂ€osuse iga kliendi jaoks. SeetĂ”ttu on jĂ€rgmise krediidi andmisel parem kasutada artikli 3. peatĂŒki lĂ”pus pakutud mudelit krediidi tagasimaksmise tĂ”enĂ€osuse hindamiseks.

Aga kui me peame maksimeerima valimi tĂ”enĂ€osuse funktsiooni, siis miks mitte kasutada mingit algoritmi, mis annaks tĂ”enĂ€osused Vasjale, Fedjale ja Ljoshale, nĂ€iteks 0.99, 0.99 ja 0.01 vastavalt. See algoritm vĂ”ib osutuda tĂ”husaks treeningu valimisel, kuna see viib valimi tĂ”enĂ€osuse lĂ€hedale Hammustades logistilist regressiooni, kuid kĂ”igepealt on sellisel algoritmil tĂ”enĂ€oliselt ĂŒldistamisvĂ”imekuse probleemid, ja teiseks, see algoritm ei ole kindlasti lineaarne. Kui meetodid ĂŒletreenimise vastu (samuti nĂ”rk ĂŒldistamisvĂ”ime) ei ole selgelt selle artikli plaanis, siis lĂ€heme teise punkti juurde lĂ€hemale. Selleks piisab lihtsale kĂŒsimusele vastamisest. Kas Vasja ja Fedja krediidi tagasimaksmise tĂ”enĂ€osus vĂ”ib olla sama, arvestades meile teadaolevaid tegureid? Tervislikust mĂ”istusest lĂ€htuvalt, loomulikult mitte, ei saa. Nii et Vasja maksab igakuiselt 2.5% oma palgast tagasi, samas kui Fedja peaaegu 27,8%. Samuti nĂ€eme, et joonisel 2 "Kliendiklassifikatsioon" asub Vasja oluliselt kauem klasside eraldusjoonest kui Fedja. Ja lĂ”puks, me teame, et funktsioon Hammustades logistilist regressiooni Vasja ja Fedja jaoks vĂ”tab erinevaid vÀÀrtusi: 4.24 Vasjale ja 1.0 Fedjale. Kui nĂ€iteks Fedja teeniks kordades rohkem vĂ”i kĂŒsiks vĂ€iksemat laenu, siis oleks Vasja ja Fedja krediidi tagasimaksmise tĂ”enĂ€osused sarnased. Teisiti öeldes, lineaarset sĂ”ltuvust ei saa petta. Ja kui me tĂ”eliselt arvutasime koefitsiendid Hammustades logistilist regressiooni, mitte ei vĂ”tnud neid lihtsalt arvesse, siis saaksime julgesti vĂ€ita, et meie vÀÀrtused Hammustades logistilist regressiooni on parimad, et hinnata iga laenuandja krediidi tagasimaksmise tĂ”enĂ€osust, kuid kuna me oleme nĂ”ustunud, et koefitsientide mÀÀramine Hammustades logistilist regressiooni toimus kĂ”igi reeglite jĂ€rgi, siis oletame, et meie koefitsiendid vĂ”imaldavad anda parima hindamise tĂ”enĂ€osusele 🙂

Kuid oleme kÔrvale kaldunud. Selles jaos peame selgeks saama, kuidas mÀÀratakse kaalude vektor Hammustades logistilist regressiooni, mis on vajalik iga laenuandja krediidi tagasimaksmise tÔenÀosuse hindamiseks.

KokkuvÔtteks, millise arsenali abil me koefitsientide otsingut alustame Hammustades logistilist regressiooni:

1. Eeldame, et seos sihtmuutuja (prognoositava vÀÀrtuse) ja tulemusele mÔju avaldava teguri vahel on lineaarne. SeetÔttu kasutatakse lineaarse regressiooni funktsioon kuju Hammustades logistilist regressiooni, mille joon jagab objektid (kliendid) klassideks Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni vÔi Hammustades logistilist regressiooni (kliendid, kes suudavad laenu tagastada ja need, kes ei suuda). Meie juhul on vÔrrandi kuju Hammustades logistilist regressiooni.

2. Kasutame tagasipööratud logit-muundamisfunktsiooni kuju Hammustades logistilist regressiooni objekti klassi kuuluvuse tÔenÀosuse mÀÀramiseks Hammustades logistilist regressiooni.

3. KĂ€sitleme meie treeningvalimit kui ĂŒldise Bernoulli skeemi, see tĂ€hendab, et iga objekti jaoks genereeritakse juhuslik muutuja, mis tĂ”enĂ€osusega Hammustades logistilist regressiooni (iga objekti oma) vĂ”tab vÀÀrtuse 1 ja tĂ”enĂ€osusega Hammustades logistilist regressiooni – 0.

4. Me teame, et peame maksimeerima valimi tĂ”enĂ€osuse funktsiooni arvestades vĂ”etud tegureid, et olemasolev valim oleks kĂ”ige tĂ”enĂ€olisem. TeisisĂ”nu, me peame leidma sellised parameetrid, mille korral valim on kĂ”ige tĂ”enĂ€olisem. Meie puhul on mÀÀratav parameeter — krediidi tagasimaksmise tĂ”enĂ€osus Hammustades logistilist regressiooni, mis sĂ”ltub omakorda tundmatutest koefitsientidest Hammustades logistilist regressiooni. Seega vajame kaalude vektorit Hammustades logistilist regressiooni, mille korral valimi tĂ”enĂ€osus on maksimaalne.

5. Teame, et maksimeerimiseks valimi tÔenÀosuse funktsiooni vÔib kasutada maksimaalne tÔenÀosusmeetod. Ja me teame kÔiki selle meetodi kohta salajaste trikke.

Nii et selline mitme sammuga protsess ongi 🙂

Ja nĂŒĂŒd tuletame meelde, et artikli alguses soovisime tuua vĂ€lja kaks erinevat kaotuse funktsiooni Logistic Loss, sĂ”ltuvalt sellest, kuidas objektide klassid on mÀÀratletud. Niisiis on tavaline, et kahe klassi klassifitseerimise ĂŒlesannetes klasifitseeritakse klassid kui Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni vĂ”i Hammustades logistilist regressiooni. Klassifikaatsiooni mÀÀratlemise pĂ”hjal on vastava vĂ€ljundi korraliku kaotuse funktsioon.

Juhtum 1. Objektide klassifitseerimine Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni

A varem, proovide tÔenÀosuse mÀÀratlemisel, kus laenuvÔtja vÔlgade tasumise tÔenÀosus arvutati lÀhtudes teguritest ja anti koefitsientidest Hammustades logistilist regressiooni, kasutasime valemit:

Hammustades logistilist regressiooni

Tegelikult Hammustades logistilist regressiooni — see on vÀÀrtus logistilise vastuse funktsioon Hammustades logistilist regressiooni antud kaaluvĂ”rgustiku vektoriga Hammustades logistilist regressiooni

Seega ei takista meid miski kirjutamast vÀlja proovide tÔenÀosuse funktsiooni nii:

Hammustades logistilist regressiooni

Kuid mĂ”nikord on mĂ”ned algajad analĂŒĂŒtikud keerulised kohe mĂ”ista, kuidas see funktsioon töötab. Uurime nelja lĂŒhikest nĂ€idet, mis kĂ”ik selgitavad:

1. Kui Hammustades logistilist regressiooni (st, kui vastavalt koolitusproovile kuulub objekt klassi +1), ja meie algoritm Hammustades logistilist regressiooni mÀÀra objekti tĂ”enĂ€osus kuuluda klassi Hammustades logistilist regressiooni olekul 0.9, nii et see tĂ”enĂ€osuse tĂŒkk arvutatakse jĂ€rgmiselt:

Hammustades logistilist regressiooni

2. Kui Hammustades logistilist regressiooni, ja Hammustades logistilist regressiooni, siis arvutus oleks selline:

Hammustades logistilist regressiooni

3. Kui Hammustades logistilist regressiooni, ja Hammustades logistilist regressiooni, siis arvutus oleks selline:

Hammustades logistilist regressiooni

4. Kui Hammustades logistilist regressiooni, ja Hammustades logistilist regressiooni, siis arvutus oleks selline:

Hammustades logistilist regressiooni

Ilmselgelt maksimeeritakse tĂ”enĂ€osuse funktsioon juhtudel 1 ja 3 vĂ”i ĂŒldiselt — Ă”igete tĂ”enĂ€osuse vÀÀrtuste puhul objekti klassile mÀÀramisel Hammustades logistilist regressiooni.

Kuna objekti tĂ”enĂ€osuse mÀÀratlemisel klassile Hammustades logistilist regressiooni ei ole meile teada ainult koefitsiendid Hammustades logistilist regressiooni, siis me otsime neid. Nagu eelpool nimetatud, on see optimeerimise probleem, kus esialgu peaksime leidma tĂ”enĂ€osuse funktsiooni derivatiivi kaaluvĂ”rgustiku vektori suhtes Hammustades logistilist regressiooni. Siiski on mĂ”istlik alustada oma ĂŒlesande lihtsustamisest: otsime derivatiivi logaritmist tĂ”enĂ€osusfunktsiooni.

Hammustades logistilist regressiooni

Miks logaritmimise jĂ€rel, logistilise vea funktsioonis, vaihtaa mĂ€rk Hammustades logistilist regressiooni jĂ€rgnevaga Hammustades logistilist regressiooni. KĂ”ik on lihtne, kuna mudeli kvaliteedi hindamise ĂŒlesannetes on tavaks miinimumida funktsiooni vÀÀrtust, seega korrutame vĂ€ljendi paremat poolt Hammustades logistilist regressiooni ja vastavalt rikka jaoks, nĂŒĂŒd miinimumime funktsiooni.

Tegelikult, praegu, teie silmade ees oli paljude kannatustega vĂ€lja tuletatud kaotuse funktsioon — Logistic Loss, kaks klassi sisaldavates koolitusproovides: Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni.

NĂŒĂŒd, koefitsiendi leidmiseks, vajame lihtsalt derivatiivi leidmist logistilise vea funktsioonis ja seejĂ€rel, kasutades numbrilisi optimeerimismeetodeid, nagu nĂ€iteks gradientide langetamine vĂ”i stohhastiline gradientide langetamine, et leida kĂ”ige optimaalsed koefitsiendid. Hammustades logistilist regressiooni. Kuid arvestades juba mitte vĂ€he artikli mahukust, soovitatakse diffeerimist iseseisvalt teha vĂ”i vĂ”ib-olla on see jĂ€rgmise suuremate arvutuste artikli teema.

Juhtum 2. Objektide klassifitseerimine Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni

LÀhenemine siin on sama, mis klasside puhul Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni, kuid tee kaotuse funktsiooni leidmiseni Logistic Loss,, on keerukam. Alustame. TÔenÀosuse funktsiooni mÀÀramiseks kasutame operaatorit "kui..., siis...". See tÀhendab, et kui Hammustades logistilist regressiooni-ndal objektil on klass Hammustades logistilist regressiooni, siis tÔenÀosuse kontseptsiooni arvutamiseks kasutame tÔenÀosust Hammustades logistilist regressiooni, kui objekt kuulub klassi Hammustades logistilist regressiooni, siis asendame tÔenÀosuse Hammustades logistilist regressiooni. Nii nÀeb vÀlja tÔenÀosuse funktsioon:

Hammustades logistilist regressiooni

KÀe peal vÀljendame, kuidas see töötab. Uurime nelja juhtumit:

1. Kui Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni, siis tÔenÀosuse proovile "jÔuab" Hammustades logistilist regressiooni

2. Kui Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni, siis tÔenÀosuse proovile "jÔuab" Hammustades logistilist regressiooni

3. Kui Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni, siis tÔenÀosuse proovile "jÔuab" Hammustades logistilist regressiooni

4. Kui Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni, siis tÔenÀosuse proovile "jÔuab" Hammustades logistilist regressiooni

Ilmselgelt 1. ja 3. juhul, kui tĂ”enĂ€osused oli algoritmiga Ă”igesti mÀÀratletud, tĂ”enĂ€osuse funktsioon maksimeeritakse, just seda me soovisime saavutada. Siiski on selline lĂ€henemine piisavalt kolossaalne ja hiljem vaatame tihedamat kirja. Kuid esmalt muudame tĂ”enĂ€osuse funktsiooni logaritmimiseks, mĂ€rkides ĂŒmber, kuna nĂŒĂŒd hakkame seda minimeerima.

Hammustades logistilist regressiooni

Asendame Hammustades logistilist regressiooni avaldusega Hammustades logistilist regressiooni:

Hammustades logistilist regressiooni

Lihtsustame Ôigusprinti logaritmibaasi all vaadata, kasutades lihtsaid aritmeetilisi meetodeid ja saame:

Hammustades logistilist regressiooni

Ja nĂŒĂŒd on aeg vabaneda operaatorist "kui..., siis...". TĂ€heldame, et kui objekt Hammustades logistilist regressiooni kuulub klassi Hammustades logistilist regressiooni, siis logaritmi avaldis, nimetaja Hammustades logistilist regressiooni on tĂ”stetud Hammustades logistilist regressiooni, kui objekt kuulub klassi Hammustades logistilist regressiooni, seega $e$ on tĂ”stetud Hammustades logistilist regressiooni. Seega saab lauseastme kirja lihtsustada — ĂŒhendame mĂ”lemad juhtumid ĂŒheks: Hammustades logistilist regressiooni. Siis logistilise vea funktsioon kuju:

Hammustades logistilist regressiooni

Logaritmimise reeglite kohaselt, pöörame murru ĂŒmber ja viime mĂ€rgi "Hammustades logistilist regressiooni" (miinus) logaritmi vĂ€lja, saame:

Hammustades logistilist regressiooni

Teie ees on kaotuse funktsioon logistic Loss, mis rakendub koolitusproovides klassidesse kuuluvate objektide suhtes: Hammustades logistilist regressiooni ja Hammustades logistilist regressiooni.

Noh, sellel hetkel ma lahkun ja lÔpetame artikli.

Hammustades logistilist regressiooni Autori eelmine töö — "Viime lineaarse regressioonivĂ”rrandi maatriksmoodusesse"

Abimaterjalid

1. Kirjandus

1) Rakendatav regressioonianalĂŒĂŒs / N. Draper, G. Smith – 2. vĂ€ljaanne – M.: Finants ja statistika, 1986 (tĂ”lge inglise keelest)

2) TĂ”enĂ€osusteooria ja matemaatiline statistika / V.E. Gmurman — 9. vĂ€ljaanne — M.: KĂ”rgkool, 2003

3) TĂ”enĂ€osusteooria / N.I. TĆĄernova — Novosibirsk: Novosibirski riiklik ĂŒlikool, 2007

4) ÄrianalĂŒĂŒs: andmetest teadmisteni / Paklin N. B., Oreshkov V. I. — 2. vĂ€ljaanne — Peterburi: Peter, 2013

5) Andmete teadus: nullist Ă”ppimine / Joel Grass — Peterburi: BHV Peterburi, 2017

6) Praktika statistika spetsialistidele Andmete Teaduses / P. Bruce, E. Bruce — Peterburi: BHV Peterburi, 2018

2. Loengud, kursused (video)

1) Maksimaalse tÔenÀosuse meetodi olemus, Boris Demeƥev

2) Maksimaalse tÔenÀosuse meetod pidevas juhtumis, Boris Demeƥev

3) Logistiline regressioon. Avatud kursus ODS, Yury Kashnitsky

4) Loeng 4, Jevgeni Sokolov (alates 47. minutist video)

5) Logistiline regressioon, VjatĆĄeslav Vorontsov

3. Internetiallikad

1) Lineaarsete klassifikaatorite ja regressioonimudelid

2) Kuidas lihtsalt mÔista logistilist regressiooni

3) Logistiline vea funktsioon

4) Iseseisvad katsed ja Bernoulli valem

5) Ballaad MMP-st

6) Maksimaalne tÔenÀosusmeetod

7) Logaritmide valemid ja omadused

8) Miks number Hammustades logistilist regressiooni?

9) Lineaarne klassifikaator

Allikas: habr.com

Osta usaldusvÀÀrne veebihosting DDoS kaitsega, VPS VDS serverid đŸ”„ Osta usaldusvÀÀrne veebihosting DDoS kaitsega, VPS VDS serverid | ProHoster