Кога трябва да проверим хипотезата за не по-малка ефективност?

Кога трябва да проверим хипотезата за не по-малка ефективност?
Статия от екипа на Stitch Fix предлага упражнение, базирано на клинични изследвания с не по-малка ефективност (непревишаване на изпитания) в маркетингови и продуктовите A/B тестове. Този подход наистина се прилага, когато тестваме ново решение, което има предимства, невъзможни за измерване с тестове.

Най-простият пример е намаляването на разходите. Например, автоматизираме процеса на назначаване на първия урок, но не искаме да намалим значително обобщената конверсия. Или тестваме промени, които се насочват към един сегмент от потребителите, като същевременно следим, за да не намалеят конверсиите в другите сегменти значително (при тестване на няколко хипотези не забравяме за поправките).

Изборът на правилната граница за не по-малка ефективност добавя допълнителни трудности на етапа на проектиране на теста. Въпросът как да изберем Δ в статията не е много добре разгледан. Изглежда, че този избор не е напълно прозрачен и в клиничните изпитания. Преглед Медицински публикации по непревишаване на ефективността съобщават, че само в половината публикации изборът на граница е обоснован и често тези обоснования са неясни или не подробни.

Във всеки случай, този подход изглежда интересен, тъй като чрез намаляване на необходимия размер на извадката може да увеличи скоростта на тестването, а следователно и скоростта на вземане на решения. — Даря Мухина, продуктов аналитик на мобилното приложение Skyeng.

Екипът на Stitch Fix обича да тества различни неща. Цялото технологично общество в принципе обича да провежда тестове. Коя версия на сайта привлича повече потребители – A или B? Принася ли версия A на модел на препоръка повече пари от версия B? Почти винаги за проверка на хипотези използваме най-простия подход от основния курс по статистика:

Кога трябва да проверим хипотезата за не по-малка ефективност?

Въпреки че рядко използваме този термин, такава форма на тестване се нарича «проверка на хипотези за превъзходство». При този подход предполагаме, че между двата варианта няма никаква разлика. Придържаме се към тази идея и се отказваме от нея само ако получените данни се окажат достатъчно убедителни за това – тоест показват, че един от вариантите (A или B) е по-добър от другия.

Проверката на хипотезата за превъзходство е подходяща за решаване на множество проблем. Пускаме версия B на препоръчителния модел само ако тя е очевидно по-добра от вече използваната версия A. Но в някои случаи този подход не работи толкова добре. Нека разгледаме няколко примера.

1) Използваме външна услуга, която помага за идентифициране на фалшиви банкови карти. Намерихме друга услуга, която струва значително по-малко. Ако по-евтината услуга работи толкова добре, колкото текущата, ние ще я изберем. Тя не трябва непременно да е по-добра от използваната услуга.

2) Искаме да се откажем от източник на данни A и да го заменим с източник на данни B. Можем да отложим отказа от A, ако B дава много лоши резултати, но не можем да продължим да използваме A.

3) Искаме да преминем от подхода на моделиранеA към подход B не защото очакваме по-добри резултати от B, а защото това ни дава по-голяма оперативна гъвкавост. Нямаме основания да смятаме, че B ще е по-лош, но няма да преминем, ако е така.

4) Направихме някои качествени промени в дизайна на уебсайта (версия B) и считаме, че тази версия превъзхожда версия A. Не очакваме промени в конверсията или някакви ключови показатели за ефективност, по които обикновено оценяваме уебсайта. Но смятаме, че има предимства в параметрите, които или не могат да бъдат измерени, или нашите технологии не са достатъчни за измерването им.

И в всичките тези случаи изследването на превъзходството не е най-подходящото решение. Но повечето специалисти в такива ситуации го използват по подразбиране. Провеждаме експеримент, за да определим правилно размера на ефекта. Ако е вярно, че версиите A и B работят по много подобен начин, има вероятност да не успеем да отхвърлим нулевата хипотеза. Правим ли извода, че A и B по принцип работят еднакво? Не! Невъзможността да отхвърлим нулевата хипотеза и приемането на нулевата хипотеза не са едно и също.

Изчисления на обема на извадката (които вие, разбира се, сте провеждали), обикновено се извършват с по-строги граници за първата грешка (вероятността за неправилно отхвърляне на нулевата хипотеза, често наричана алфа) отколкото за втората грешка (вероятността да не отхвърлим нулевата хипотеза, при условие, че тя е грешна, често наричана бета). Типичната стойност за алфа е 0,05, докато типичната стойност за бета е 0,20, което съответства на статистическа мощност 0,80. Това означава, че можем да не открием истинския ефект на величината, която указахме в нашите изчисления за мощността, с вероятност от 20%, и това е доста съществен пропуск в информацията. Като пример, нека разгледаме следните хипотези:

Кога трябва да проверим хипотезата за не по-малка ефективност?

H0: моят ранец НЕ е в стаята ми (3)
H1: моят ранец е в стаята ми (4)

Ако съм претърсил стаята си и намерил раницата - отлично, мога да отхвърля нулевата хипотеза. Но ако съм прегледал стаята и не съм намерил раницата (фигура 1), какво заключение трябва да направя? Убеден ли съм, че я няма там? Достатъчно ли внимателно съм търсил? Какво, ако съм проверил само 80% от стаята? Да заключа, че раницата определено я няма в стаята, би било прибързано решение. Не е изненада, че не можем „да приемем нулевата хипотеза“.
Кога трябва да проверим хипотезата за не по-малка ефективност?
Областта, която претърсихме
Не намерихме раницата - трябва ли да приемем нулевата хипотеза?

Фигура 1. Претърсването на 80% от стаята е приблизително същото като провеждането на проучване с мощност 80%. Ако не сте намерили раницата, проверявайки 80% от стаята, могат ли да се направят заключения, че я няма там?

Какво да прави специалистът по данни в тази ситуация? Можете значително да увеличите мощността на проучването, но тогава ще ви е необходима много по-голяма извадка, а резултатът все още може да е неудовлетворителен.

За щастие, подобни проблеми се изучават отдавна в света на клиничните проучвания. Препарат B е по-евтин от препарат A; очаква се препарат B да има по-малко странични ефекти от препарат A; препарат B е по-лесен за транспортиране, тъй като не е необходимо да се съхранява в хладилник, докато препарат A е нужен. Ще проверим хипотезата за не по-малка ефективност. Това е нужно, за да покажем, че версия B е толкова добра, колкото версия A — поне в границите на предварително определен предел за “не по-малка ефективност”, Δ. Малко по-късно ще говорим по-подробно за това как да установим този предел. Но сега да предположим, че това е минималната разлика, която е практически значима (в контекста на клиничните изпитвания това обикновено се нарича клинична значимост).

Хипотезите за не по-малка ефективност обръщат всичко с краката нагоре:

Кога трябва да проверим хипотезата за не по-малка ефективност?

Сега вместо да предполагаме, че разликата отсъства, ние предполагаме, че версия B е по-лоша от версия A и ще се придържаме към това предположение, докато не демонстрираме, че не е така. Точно в този момент има смисъл да използваме тест за едностранна хипотеза! На практика това може да бъде направено чрез изграждане на доверителен интервал и определяне дали наистина интервалът е по-голям от Δ (фигура 2).
Кога трябва да проверим хипотезата за не по-малка ефективност?

Избор на Δ

Как правилно да изберем Δ? Процесът на избор на Δ включва статистическо обоснование и предметна оценка. В света на клиничните изследвания съществуват нормативни насоки, които показват, че делтата трябва да представлява най-малкото клинично значимо различие — такова, което ще има значение на практика. Ето цитат от европейското ръководство, с помощта на което можете да се проверите: „Ако разликата е избрана правилно, доверителният интервал, който напълно попада между –∆ и 0…, все още е достатъчен, за да демонстрира не по-малка ефективност. Ако този резултат не изглежда приемлив, това означава, че ∆ не е избрана надлежно“.

Делтата определено не трябва да надвишава величината на ефекта от версия A спрямо истинския контрол (плацебо / липса на лечение), тъй като това ни води до заключение, че версия B е по-лоша от истинския контрол, и в същото време демонстрира „не по-малка ефективност“. Да предположим, че когато е била представена версия A, на нейно място е била версия 0 или функцията изобщо не е съществувала (вж. фигура 3).

По резултатите от проверката на хипотезата за превъзходство беше установена величината на ефекта E (т.е. предполагаемо μ^A−μ^0=E). Сега A е нашият нов стандарт и искаме да се уверим, че B не отстъпва на A. Друг начин да запишем μB−μA≤−Δ (нулева хипотеза) е μB≤μA−Δ. Ако приемем, че е равно или надвишава E, тогава μB ≤ μA−E ≤ плацебо. Сега виждаме, че нашата оценка за μB напълно надхвърля μA−E, което напълно опровергава нулевата хипотеза и позволява да заключим, че B не отстъпва на A, но в същото време μB може да бъде ≤ μ плацебо, а това не е, което искаме. (фигура 3).

Кога трябва да проверим хипотезата за не по-малка ефективност?
Фигура 3. Демонстрация на рисковете от избор на граница на не по-малка ефективност. Ако пределът е прекалено голям, може да се заключи, че B не отстъпва на A, но в същото време е неразличим от плацебо. Няма да сменим препарат, който е явно по-ефективен от плацебо (A), с препарат, който има същата ефективност като плацебо.

Избор на α

Придвижваме се към избора на α. Може да се използва стандартната стойност α = 0,05, но това не е напълно честно. Например, когато купувате нещо онлайн и използвате няколко кодове за отстъпка, въпреки че те не трябва да се сумират — просто разработчикът е допуснал грешка и вие сте се измъкнали. Според правилата стойността на α трябва да бъде равна на половината от стойността на α, която се използва при проверката на хипотезата за превъзходство, т.е. 0,05 / 2 = 0,025.

Размер на извадката

Как да оценим размера на извадката? Ако смятате, че истинската разлика между средните стойности на A и B е 0, то изчислението на размера на извадката ще бъде същото като при проверката на хипотезата за превъзходство, с изключение на това, че заменяте размера на ефекта с границата на не по-малка ефективност, при условие че използвате αне по-малка ефективност = 1/2αпревъзходство (αнепоносимост=1/2αпревосходство). Ако имате основания да смятате, че вариант B може да е малко по-лош от вариант A, но искате да докажете, че е не по-лош от Δ, тогава имате късмет! Всъщност това намалява размера на пробата ви, защото е по-лесно да докажете, че B е по-лошо от A, ако наистина смятате, че е малко по-лошо, а не равноценно.

Пример с решение

Да предположим, че искате да преминете на версия B при условие, че тя е по-лоша от версия A не повече от 0,1 пункта по 5-балната скала на удовлетвореност на клиентите… Нека се заемем с тази задача, използвайки хипотезата за превъзходство.

За проверка на хипотезата за превъзходство, бихме изчислили размера на пробата по следния начин:

Кога трябва да проверим хипотезата за не по-малка ефективност?

Тоест, ако имате 2103 наблюдения в групата си, можете да бъдете на 90% уверени, че ще откриете ефект с големина 0,10 или по-голям. Но ако 0,10 за вас е твърде голямо, може би не си струва да проверявате хипотезата за превъзходство за него. Може би за надеждност ще решите да проведете изследване за по-малък размер на ефекта, например 0,05. В такъв случай ще ви трябват 8407 наблюдения, тоест размерът на пробата ще нарасне почти 4 пъти. Но какво ще стане, ако се придържаме към първоначалния си размер на пробата, но увеличим мощността до 0,99, за да нямаме съмнения, ако получим положителен резултат? В такъв случай n за една група ще бъде 3676, което вече е по-добре, но увеличава размера на пробата с над 50%. И в крайна сметка, ние просто няма да можем да опровергаем нулевата хипотеза, а не да получим отговор на въпроса си.

Какво ако вместо това проверим хипотезата за не по-лоша ефективност?

Кога трябва да проверим хипотезата за не по-малка ефективност?

Размерът на пробата ще се изчислява по същата формула с изключение на знаменателя.
Разликите от формулата, използвана при проверка на хипотезата за превъзходство, са следните:

— Z1−α/2 се заменя с Z1−α, но ако правите всичко по правилата, заменяте α = 0,05 с α = 0,025, тоест, това е едно и също число (1,96)

— в знаменателя се появява (μB−μA)

— θ(размер на ефекта) се заменя с Δ (праг на не по-лоша ефективност)

Ако предположим, че µB = µA, тогава (µB − µA) = 0 и изчислението на размера на извадката за ограничения с не по-малка ефективност е точно това, което бихме получили при изчисляване на превъзходството за величината на ефекта 0,1, отлично! Можем да проведем проучване с една и съща мащабна структура с различни хипотези и различен подход към заключенията и ще получим отговор на въпроса, на който наистина искаме да отговорим.

Сега да предположим, че всъщност не смятаме, че µB = µA и
мислим, че µB е малко по-лошо, може би с 0,01 единици. Това увеличава нашия знаменател, намалявайки размера на извадката за групата до 1737.

Какво ще се случи, ако версия B всъщност е по-добра от версия A? Отхвърляме нулевата хипотеза, че B е по-лошо от A, с повече от Δ и приемаме алтернативната хипотеза, че B, ако е по-лошо, не е по-лошо с повече от Δ и може би е по-добро. Опитайте да включите това заключение в крос-функционална презентация и вижте какво ще се получи (сериозно, опитайте). В ситуация, в която трябва да се ръководим от перспектива, никой не иска да се съгласява на „по-лошо не повече от Δ и, може би, по-добро”.

В този случай можем да проведем проучване, което се нарича много кратко „проверка на хипотезата, че една от опциите превъзхожда другата или е по-ниска от нея“. В него се използват два набора хипотези:

Първият набор (такъв, какъвто е при проверка на хипотезата за не по-малка ефективност):

Кога трябва да проверим хипотезата за не по-малка ефективност?

Вторият набор (такъв, какъвто е при проверка на хипотезата за превъзходство):

Кога трябва да проверим хипотезата за не по-малка ефективност?

Проверяваме втората хипотеза само в случай, че първата бъде отхвърлена. При последователно тестване запазваме общото ниво на грешки от първи род (α). На практика това може да бъде постигнато чрез създаване на 95 % доверителен интервал за разликата между средните и проверка, за да се определи дали целият интервал надвишава -Δ. Ако интервалът не надвишава -Δ, не можем да отхвърлим нулевата хипотеза и спираме. Ако целият интервал всъщност надвишава -Δ, ще продължим и ще видим дали интервалът съдържа 0.

Съществува още един вид проучвания, които не обсъдихме – изследвания за еквивалентност.

Изследвания от този тип могат да бъдат заменени с изследвания за проверка на хипотезата за не по-малка ефективност и обратно, но те имат важно отличие. Изпитването за проверка на хипотезата за не по-малка ефективност е насочено към доказване, че вариант B е поне толкова добър, колкото A. А изследването за еквивалентност цели да покаже, че вариант B е поне толкова добър, колкото A, а вариант A е толкова добър, колкото B, което е по-сложно. По същество се опитваме да определим дали целият доверителен интервал за разликата на средните стойности попада между −Δ и Δ. Такива изследвания изискват по-голям размер на пробата и се провеждат по-рядко. Затова, когато следващия път провеждате изследване, чиято основна задача е да потвърди, че новата версия не е по-лоша, не се съгласявайте с „невъзможността да отхвърлите нулевата хипотеза“. Ако искате да тествате наистина важна хипотеза, обмислете различни опции.

Източник: habr.com

Купете надежден хостинг за сайтове със защита от DDoS, VPS и VDS сървъри 🔥 Купете надежден хостинг за сайтове със защита от DDoS, VPS и VDS сървъри | ProHoster