Pruebas de Hipotesis y Regresion Lineal Simple
Las pruebas de hipotesis son transversales a todo el CFA: desde probar si el alpha de un gestor es estadisticamente significativo hasta validar supuestos de modelos de regresion. La regresion lineal simple aparece directamente en Metodos Cuantitativos y como base conceptual en Analisis de Estados Financieros y Gestion de Cartera. El examen pide saber elegir el test correcto segun el contexto y calcular el estadistico de prueba.
Hipotesis nula y alternativa
Una prueba de hipotesis es un procedimiento estadistico para decidir, con base en datos muestrales, si hay evidencia suficiente para rechazar una afirmacion sobre una poblacion.
Hipotesis nula (H0): la afirmacion que se somete a prueba. Generalmente representa el "status quo" o la ausencia de efecto. Se rechaza solo si los datos proporcionan evidencia suficiente en su contra.
Hipotesis alternativa (H1): la afirmacion que el investigador quiere demostrar. Si H0 es falsa, H1 debe ser verdadera.
Tipos de prueba segun H1:
- Dos colas (two-tailed): H1: parametro != valor0. Se usa cuando el desvio puede ser en cualquier direccion. La region de rechazo esta en ambas colas.
- Cola superior (one-tailed right): H1: parametro > valor0. Se usa cuando solo interesa detectar desvios positivos.
- Cola inferior (one-tailed left): H1: parametro < valor0. Se usa cuando solo interesa detectar desvios negativos.
Ejemplo: un gestor afirma que su alpha promedio es mayor que cero.
- H0: alpha = 0
- H1: alpha > 0 (una cola, derecha)
Errores tipo I y tipo II
Siempre existe la posibilidad de cometer errores al rechazar o no rechazar H0.
Error tipo I (alfa): rechazar H0 cuando H0 es verdadera. Es el error "falso positivo". La probabilidad de cometer este error es el nivel de significancia alfa, que el investigador fija antes de la prueba (tipicamente 1%, 5% o 10%).
Error tipo II (beta): no rechazar H0 cuando H0 es falsa. Es el error "falso negativo". Es mas dificil de controlar directamente.
Potencia del test (power) = 1 - beta: probabilidad de rechazar correctamente H0 cuando es falsa. Se maximiza con muestras mas grandes, mayor nivel de significancia o cuando el efecto real es grande.
Tradeoff alfa-beta: reducir alfa (exigir mas evidencia para rechazar H0) aumenta beta (se pierde potencia para detectar efectos reales). No se puede minimizar ambos simultaneamente a tamaño de muestra fijo.
En finanzas, el nivel de significancia mas comun es alfa = 5%. Esto significa que aceptamos un 5% de probabilidad de rechazar incorrectamente H0 (falso positivo). Un resultado "estadisticamente significativo" al 5% NO implica que el efecto sea economicamente importante — solo implica que es poco probable que sea cero dado el tamano de muestra.
p-value: definicion e interpretacion
El p-value es la probabilidad de obtener un estadistico de prueba tan extremo como el observado (o mas), asumiendo que H0 es verdadera.
Regla de decision: si p-value < alfa, rechazar H0. Si p-value >= alfa, no rechazar H0 (nunca se "acepta" H0).
Interpretacion correcta: un p-value de 0.03 significa "si H0 fuera verdadera, habria solo un 3% de probabilidad de observar datos tan extremos como los nuestros". No significa "hay un 97% de probabilidad de que H1 sea verdadera".
Ejemplo: un analista prueba si el alpha de un fondo es diferente de cero. Calcula t = 2.45 con df = 59 (muestra de 60 meses). El p-value es 0.017. Con alfa = 5%, rechaza H0 y concluye que el alpha es estadisticamente significativo.
Estadisticos de prueba: cuando usar cada uno
z-test para medias: se usa cuando la varianza poblacional es conocida o la muestra es grande (n >= 30 por el Teorema Central del Limite).
t-test para medias: el caso mas comun en finanzas. La varianza poblacional casi nunca es conocida. Con df = n-1, el valor critico t_(alfa/2) siempre es mayor que el z correspondiente (colas mas gruesas), siendo mas conservador.
Chi-cuadrado: distribucion asimetrica, usada para pruebas sobre varianzas poblacionales o para pruebas de bondad de ajuste. Siempre positivo.
F-test: cociente de dos varianzas muestrales independientes. La hipotesis nula es H0: sigma1^2 = sigma2^2. Tambien es el estadistico central del ANOVA de la regresion.
Regresion lineal simple
La regresion lineal simple modela la relacion lineal entre una variable dependiente Y y una variable independiente X:
Y = b0 + b1 x X + epsilon
donde:
- b0 = intercepto (valor de Y cuando X = 0)
- b1 = pendiente (cambio en Y por unidad de cambio en X)
- epsilon = termino de error aleatorio (residuo)
Estimacion por Minimos Cuadrados Ordinarios (OLS / MCO): el metodo OLS minimiza la suma de los cuadrados de los residuos (SSE). Las formulas de los estimadores:
b1_hat = Cov(X,Y) / Var(X) = [sum(xi - x_barra)(yi - y_barra)] / [sum(xi - x_barra)^2]
b0_hat = y_barra - b1_hat x x_barra
Los estimadores OLS son los Best Linear Unbiased Estimators (BLUE) bajo los supuestos de Gauss-Markov.
Supuestos de Gauss-Markov (OLS)
Para que los estimadores OLS sean BLUE, deben cumplirse cinco supuestos:
- Linealidad: la relacion entre X e Y es lineal en los parametros.
- Exogeneidad: E[epsilon | X] = 0. Los errores no estan correlacionados con X.
- Homocedasticidad: Var(epsilon | X) = sigma^2 constante. La varianza del error no depende de X.
- No autocorrelacion: Cov(epsilon_i, epsilon_j) = 0 para i != j. Los errores no estan correlacionados entre si.
- No multicolinealidad perfecta: (en regresion multiple) las variables independientes no son combinaciones lineales exactas entre si.
Violaciones frecuentes en series financieras: heterocedasticidad (la volatilidad cambia con el tiempo) y autocorrelacion en residuos (los errores del periodo t estan correlacionados con los del periodo t-1).
ANOVA de la regresion: SST, SSR, SSE
El ANOVA descompone la variabilidad total de Y en dos componentes:
SST = SSR + SSE
donde:
- SST (Total Sum of Squares): variabilidad total de Y alrededor de su media. sum(yi - y_barra)^2
- SSR (Regression Sum of Squares): variabilidad de Y explicada por el modelo. sum(y_hat_i - y_barra)^2
- SSE (Error Sum of Squares): variabilidad no explicada (residuos). sum(yi - y_hat_i)^2
Coeficiente de determinacion R^2:
R^2 = SSR / SST = 1 - SSE/SST
R^2 varia entre 0 y 1. Un R^2 = 0.72 significa que el modelo explica el 72% de la variabilidad de Y. El 28% restante queda en los residuos.
Correlacion y R^2: en regresion simple, R^2 = rho^2, donde rho es la correlacion entre X e Y. Esto no aplica en regresion multiple.
F-test de la regresion: prueba si el modelo explica una proporcion significativa de la variabilidad de Y (H0: b1 = 0).
F = (SSR / k) / (SSE / (n-k-1))
donde k = numero de regresores (k=1 en regresion simple).
Intervalos de confianza para coeficientes de regresion
El intervalo de confianza del (1-alfa)% para el coeficiente b1 es:
IC(b1) = b1_hat +/- t_(alfa/2, n-2) x SE(b1_hat)
donde SE(b1_hat) es el error estandar del estimador y los grados de libertad son n-2 (perdemos uno por b0 y uno por b1).
Si el IC del 95% para b1 no incluye el 0, rechazamos H0: b1 = 0 al 5% de significancia.
Quiz de autoevaluacion
PREGUNTA DE COMPRENSIÓN
Un gestor afirma que su fondo tiene alpha positivo. Con 48 meses de datos, calcula alpha = 0.8% mensual con error estandar 0.35%. El estadistico t vale 2.29. Con alfa = 5%, que concluyes? Usa una prueba de una cola (cola superior).
↳ RESPUESTA
H0: alpha = 0, H1: alpha > 0 (una cola, derecha).
Con df = 48 - 1 = 47, el valor critico t_(0.05, 47) ≈ 1.678.
Como t calculado = 2.29 > 1.678 = t critico, rechazamos H0.
Conclusion: hay evidencia estadisticamente significativa al 5% de que el alpha del gestor es positivo. El p-value es aproximadamente 0.013 (< 0.05).
Nota importante: este resultado dice que el alpha es distinto de cero estadisticamente. No dice nada sobre si el alpha es sostenible en el futuro ni si el gestor tendra el mismo rendimiento con un fondo mas grande.
PREGUNTA DE COMPRENSIÓN
En una regresion de los retornos de una accion (Y) contra el retorno del mercado (X), obtienes: b0 = 0.2%, b1 = 1.35, R^2 = 0.68. Interpreta cada uno de estos tres resultados.
↳ RESPUESTA
-
b0 = 0.2% (intercepto / alpha): cuando el mercado tiene retorno 0%, la accion se espera que retorne 0.2% en promedio. En el contexto CAPM, esto seria el alpha de Jensen — un alpha positivo sugiere que la accion genera retorno en exceso del esperado por su riesgo sistematico.
-
b1 = 1.35 (pendiente / beta): la accion es mas volatil que el mercado. Si el mercado sube 1%, la accion tiende a subir 1.35%. Beta > 1 implica mayor riesgo sistematico que el mercado.
-
R^2 = 0.68: el 68% de la variabilidad de los retornos de la accion es explicado por los movimientos del mercado. El 32% restante es riesgo especifico (idiosincratico), que puede eliminarse con diversificacion. La correlacion entre la accion y el mercado es sqrt(0.68) ≈ 0.82.
PREGUNTA DE COMPRENSIÓN
Cual es la diferencia entre un error tipo I y un error tipo II? Que pasa si bajamos el nivel de significancia de 5% a 1%?
↳ RESPUESTA
- Error tipo I (alfa): rechazar H0 cuando H0 es verdadera. Es el falso positivo. Su probabilidad es exactamente el nivel de significancia alfa que el investigador elige.
- Error tipo II (beta): no rechazar H0 cuando H0 es falsa. Es el falso negativo. Su probabilidad depende del tamano del efecto real, el tamano de muestra y alfa.
Si bajamos alfa de 5% a 1%:
- Reducimos la probabilidad de cometer error tipo I (exigimos mas evidencia para rechazar H0).
- Pero aumentamos la probabilidad de cometer error tipo II (al ser mas exigentes, es mas probable que no detectemos efectos reales que existen).
- La potencia del test (1-beta) disminuye.
Analogia: si subimos el umbral de conviccion para declarar culpable a un acusado, reducimos las condenas injustas (error tipo I) pero aumentamos la probabilidad de absolver a culpables (error tipo II).
PREGUNTA DE COMPRENSIÓN
Describes una regresion con heterocedasticidad. Que supuesto de Gauss-Markov viola? Que efecto tiene sobre los estimadores OLS?
↳ RESPUESTA
La heterocedasticidad viola el supuesto 3 de Gauss-Markov: Var(epsilon | X) = sigma^2 constante.
Cuando la varianza del error no es constante (ej: los residuos son mayores para valores altos de X), los estimadores OLS:
- Siguen siendo insesgados: b0_hat y b1_hat siguen siendo correctos en promedio.
- Pero dejan de ser eficientes (BLUE): existen otros estimadores lineales insesgados con menor varianza (ej: Minimos Cuadrados Generalizados, GLS).
- Los errores estandar calculados son incorrectos: los intervalos de confianza y las pruebas t/F dan resultados equivocados. Se puede rechazar H0 cuando no deberia (o viceversa).
Solucion: usar errores estandar robustos a heterocedasticidad (errores de White/Huber-White) o transformar las variables (ej: logaritmos). En series financieras, la heterocedasticidad condicional autorregresiva (ARCH/GARCH) es el modelo estandar para capturar la volatilidad variable en el tiempo.
Material educativo para CFA Level I. No afiliado al CFA Institute. Los ejemplos numericos son ilustrativos y no constituyen asesoramiento de inversion.