Cómo medimos los resultados de SignalXI
Evaluar un modelo exige más que contar victorias. SignalXI registra cada recomendación publicada para analizar rendimiento, calibración y estabilidad con el paso del tiempo.
1. Registro antes del resultado
Una recomendación debe quedar registrada antes de que el partido se resuelva. Guardamos mercado, selección, cuota, probabilidad, clasificación y fecha. Esto reduce el riesgo de seleccionar retrospectivamente solo los resultados favorables.
2. Hit Rate
El Hit Rate es el porcentaje de recomendaciones ganadas entre las que tienen resultado definitivo. Es intuitivo, pero no basta por sí solo: una estrategia con alta tasa de acierto puede ser poco rentable si sus cuotas son demasiado bajas.
3. ROI y profit
El ROI relaciona el beneficio o pérdida acumulada con las unidades arriesgadas. Profit muestra el resultado neto en unidades. Estas métricas incorporan el precio y permiten comparar mejor segmentos con cuotas diferentes.
4. Cuota media y distribución
Observamos la cuota media porque ayuda a contextualizar el Hit Rate. También revisamos cómo se distribuyen las recomendaciones por mercado, competición y nivel de confianza para detectar si un resultado agregado oculta diferencias importantes.
5. Brier Score
El Brier Score evalúa la calidad de una probabilidad, no solo si un pick ganó o perdió. Penaliza estimaciones que asignan demasiada confianza a eventos que luego no ocurren y ayuda a comprobar si las probabilidades están bien calibradas.
6. Calibración
Un modelo bien calibrado debería observar, en muestras suficientemente grandes, frecuencias reales cercanas a sus probabilidades estimadas. Por ejemplo, los eventos etiquetados alrededor de 70% deberían resolverse favorablemente aproximadamente en esa zona a largo plazo, no necesariamente en una muestra pequeña.
7. Tamaño de muestra
No consideramos concluyente una racha corta. Unos pocos aciertos o fallos pueden cambiar mucho las métricas iniciales. Por eso SignalXI evita presentar una muestra reducida como prueba definitiva de que un modelo funciona o ha dejado de funcionar.
8. Mostrar también los fallos
La transparencia exige conservar resultados negativos. La página pública de resultados incluye recomendaciones ganadas y perdidas porque el objetivo es medir el sistema real, no construir una selección retrospectiva favorable.
Consultar resultados registrados →