
El objetivo del artículo es brindar apoyo a los aspirantes a científicos de datos. En este artículo desglosamos de manera sencilla tres métodos para resolver la ecuación de regresión lineal: la solución analítica, el descenso por gradiente y el descenso por gradiente estocástico. Para la solución analítica, aplicamos la fórmula
. En este artículo, como se indica en el título, fundamentaremos la aplicación de esta fórmula o, en otras palabras, la derivaremos por nosotros mismos.
Por qué tiene sentido prestar especial atención a la fórmula
?
Justamente con la ecuación matricial es donde la mayoría de los casos comienza el aprendizaje sobre la regresión lineal. Sin embargo, los desarrollos detallados sobre cómo se derivó la fórmula son poco frecuentes.
Por ejemplo, en los cursos de aprendizaje automático de Yandex, cuando se familiariza a los asistentes con la regularización, se les sugiere utilizar funciones de la biblioteca sklearn, y no se menciona en absoluto la representación matricial del algoritmo. En este momento, algunos asistentes pueden sentir el deseo de profundizar en este tema, es decir, escribir código sin utilizar funciones predefinidas. Para ello, primero se debe representar la ecuación con el regularizador en forma matricial. Este artículo, precisamente, permitirá a quienes deseen adquirir tales habilidades. Empecemos.
Condiciones iniciales
Indicadores objetivo
Disponemos de una serie de valores del indicador objetivo. Por ejemplo, un indicador objetivo podría ser el precio de un activo: petróleo, oro, trigo, dólar, etc. Cuando hablamos de una serie de valores del indicador objetivo nos referimos a la cantidad de observaciones. Estas observaciones pueden ser, por ejemplo, los precios mensuales del petróleo durante un año, por lo que tendríamos 12 valores del indicador objetivo. Comencemos a introducir las denominaciones. Denotemos cada valor del indicador objetivo como
. En total, tenemos
observaciones, lo que significa que podemos representar nuestras observaciones como
.
regresores
Supongamos que existen factores que explican, en cierta medida, los valores de la variable objetivo. Por ejemplo, el tipo de cambio del dólar/rublo está fuertemente influenciado por el precio del petróleo, la tasa de la Reserva Federal y otros. Estos factores se llaman regresores. De este modo, a cada valor de la variable objetivo debe corresponder un valor del regresor, es decir, si tenemos 12 variables objetivo por cada mes de 2018, también debemos tener 12 valores de regresores para el mismo período. Denotaremos los valores de cada regresor mediante
. Supongamos que en nuestro caso hay
regresoress (es decir,
factores que influyen en los valores de la variable objetivo). Entonces, nuestros regresores se pueden representar de la siguiente manera: para el 1er regresor (por ejemplo, el precio del petróleo):
, para el 2do regresor (por ejemplo, la tasa de la Reserva Federal):
, para el «
-ésimo» regresor: 
La dependencia de las variables objetivo de los regresores
Supongamos que la dependencia de la variable objetivo
de los regresores «
-ésimo» puede expresarse a través de una ecuación de regresión lineal de la forma:

, donde
— «
-ésimo» valor del regresor de 1 a
,
— número de regresores de 1 a 
— coeficientes angulares que representan la magnitud por la cual cambiará, en promedio, la variable objetivo calculada al cambiar el regresor.
En otras palabras, para cada regresor (exceptuando
) determinamos su «propio» coeficiente
, luego multiplicamos los coeficientes por los valores de los regresores «
-ésimo» observación, obteniendo como resultado una aproximación del «
-ésimo» variable objetivo.
Por lo tanto, necesitamos encontrar coeficientes tales que
, donde los valores de nuestra función de aproximación
estén lo más cerca posible de los valores de las variables objetivo.
Evaluación de la calidad de la función de aproximación
Vamos a determinar la evaluación de la calidad de la función de aproximación mediante el método de mínimos cuadrados. La función de evaluación de la calidad, en este caso, tomará la siguiente forma:

Necesitamos encontrar valores de coeficientes $w$ tales que el valor
sea el menor.
Convertimos la ecuación en forma matricial
Representación vectorial
Para comenzar, para facilitar nuestro trabajo, debemos prestar atención a la ecuación de regresión lineal y notar que el primer coeficiente
no se multiplica por ningún regresor. Sin embargo, cuando transformemos los datos en forma matricial, esta circunstancia complicará seriamente los cálculos. En este sentido, se sugiere introducir otro regresor para el primer coeficiente
y equipararlo a uno. Mejor dicho, cada "
-ésimo" valor de este regresor se equipara a uno, ya que al multiplicar por uno no cambia el resultado de los cálculos y, en términos de las reglas del producto matricial, nuestras dificultades se reducirán significativamente.
Ahora, por un tiempo, para simplificar el material, supongamos que solo tenemos una "
-ésima" observación. Entonces, consideremos los valores de los regresores de la "
-ésima" observación como un vector
. El vector
tiene dimensiones
, es decir, el
filas y 1 columna:

Los coeficientes buscados los representaremos como un vector
, que tiene dimensiones
:

La ecuación de regresión lineal para la "
-ésima" observación tomará la forma:

La función de evaluación de la calidad del modelo lineal será:

Cabe destacar que, de acuerdo con las reglas de multiplicación de matrices, tuvimos que transponer el vector
.
Representación matricial
Como resultado de la multiplicación de los vectores, obtendremos un número:
, lo cual era de esperar. Este número es la aproximación al "
-ésimo" indicador objetivo. Pero necesitamos la aproximación no de un solo indicador objetivo, sino de todos. Para ello, registraremos todos los "
-ésimos" regresores en formato de matriz
. La matriz resultante tiene dimensiones
:

Ahora la ecuación de regresión lineal tomará la forma:

Denotaremos los valores de los indicadores objetivo (todos
) como un vector
de dimensión
:

Ahora podemos escribir en formato matricial la ecuación de evaluación de la calidad del modelo lineal:

De hecho, de esta fórmula se obtiene la conocida fórmula 
¿Cómo se hace esto? Se abren los paréntesis, se realiza la diferenciación, se transforman las expresiones obtenidas, etc., y precisamente esto es lo que haremos ahora.
Transformaciones matriciales
Abramos los paréntesis


Preparemos la ecuación para la diferenciación
Para esto, realizaremos algunas transformaciones. En los cálculos posteriores, será más conveniente si el vector
se presenta al comienzo de cada producto en la ecuación.
Transformación 1

¿Cómo sucedió esto? Para responder a esta pregunta, es suficiente con observar las dimensiones de las matrices multiplicadas y ver que obtenemos un número o, de otra manera,
.
Escribamos las dimensiones de las expresiones matriciales.



Transformación 2

Desarrollaremos de manera similar a la transformación 1


En la salida obtenemos la ecuación que necesitamos diferenciar:

Derivamos la función de evaluación de la calidad del modelo
Diferenciemos con respecto al vector
:




No deberían existir preguntas sobre por qué
, pero las operaciones de definición de derivadas en las otras dos expresiones las analizaremos más a fondo.
Diferenciación 1
Desarrollemos la diferenciación: 
Para definir la derivada de una matriz o vector, necesitamos observar qué hay dentro de ellos. Veamos:



Denotaremos el producto de matrices
a través de la matriz
. La matriz
es cuadrada y, además, es simétrica. Estas propiedades nos serán útiles más adelante, recordémoslas. La matriz
tiene dimensiones
:

Ahora nuestra tarea es multiplicar correctamente los vectores por la matriz y no obtener 'dos por dos cinco', así que concentrémonos y seamos extremadamente cuidadosos.




Sin embargo, ¡nos ha salido una expresión compleja! En realidad, hemos obtenido un número: un escalar. Y ahora, realmente, pasamos a la diferenciación. Es necesario encontrar la derivada de la expresión obtenida con respecto a cada coeficiente
y obtener como resultado un vector de dimensión
. Por si acaso, anotaré los procedimientos a seguir:
1) diferenciamos con respecto a
, obtenemos: 
2) diferenciamos con respecto a
, obtenemos: 
3) diferenciamos con respecto a
, obtenemos: 
Como resultado, el prometido vector de tamaño
:

Si observamos más de cerca el vector, podemos notar que los elementos izquierdos y los correspondientes derechos del vector se pueden agrupar de tal manera que, al final, del vector presentado se puede destacar un vector
de tamaño
. Por ejemplo,
(el elemento izquierdo de la fila superior del vector)
(el elemento derecho de la fila superior del vector) se puede representar como
, y
— como
etc. para cada fila. Agrupemos:

Sacaremos el vector
y en la salida obtendremos:

Ahora, observemos la matriz resultante. La matriz es la suma de dos matrices
:

Recordemos que hace un momento mencionamos una propiedad importante de la matriz
— es simétrica. Basándonos en esta propiedad, podemos afirmar con confianza que la expresión
es igual a
. Es fácil comprobarlo, desglosando el producto de matrices elemento por elemento.
. No lo haremos aquí, los interesados pueden verificar por su cuenta.
Volvamos a nuestra expresión. Después de nuestras transformaciones, ha quedado tal como queríamos verlo:

Así que hemos terminado con la primera diferenciación. Pasemos a la segunda expresión.
Diferenciación 2

Sigamos el camino trazado. Será mucho más corto que el anterior, así que no se alejen demasiado de la pantalla.
Desglosaremos elemento por elemento los vectores y la matriz:



Por un momento eliminemos el dos de los cálculos, no juega un papel importante, y luego lo devolveremos. Multiplicaremos los vectores por la matriz. Primero multiplicaremos la matriz
por el vector
, aquí no tenemos ninguna restricción. Obtendremos un vector de tamaño
:

Realizaremos la siguiente acción: multiplicaremos el vector
por el vector obtenido. Al salir, nos estará esperando un número:

Ese es el que diferenciamos. Al final obtendremos un vector de dimensión
:

¿Te suena familiar? ¡Exacto! Es el producto de la matriz
por el vector
.
Así, la segunda diferenciación se ha completado con éxito.
En conclusión
Ahora sabemos cómo se obtuvo la igualdad
.
Por último, describamos un camino rápido para transformar las fórmulas básicas.
Evaluaremos la calidad del modelo de acuerdo con el método de mínimos cuadrados:


Diferenciamos la expresión obtenida:


Literatura
Fuentes de internet:
1)
2)
3)
4)
Libros de texto, colecciones de problemas:
1) Apuntes de lecciones de matemáticas avanzadas: curso completo / D.T. Písменный – 4ª ed. – M.: Iris-press, 2006
2) Análisis de regresión aplicada / N. Draper, G. Smith – 2ª ed. – M.: Finanzas y estadística, 1986 (traducción del inglés)
3) Problemas sobre resolución de ecuaciones matriciales:
Fuente: habr.com
