AMV - Uso de algoritmos de Machine Learning en el monitoreo de mercados
Autorregulador del Mercado de Valores de Colombia
Descargar PDF
Disponible
Detalles
- Título
- AMV - Uso de algoritmos de Machine Learning en el monitoreo de mercados
- Autor
- Autorregulador del Mercado de Valores de Colombia
- Categoría
- Infralegal
- Área del derecho
- Financiero
- Año
- —
1
Contenido
................................ ................................ ................................ ................................ ............ 0
1. Introducción ....................................................................................................... 2
2. Métodos tradicionales – los canales de precios .......................................... 4
3. Aspectos metodológicos – algoritmos de Machine Learning ................... 9 3.1. Support Vector Machines (SVM) ................................ ................................ ...... 10 3.2. Random Forest ................................ ................................ ................................ .... 14 3.3. Redes Neuronales Multicapa (MLP) ................................ ................................ 17 3.4. Isolation Forest ................................ ................................ ................................ .... 20 3.5. Gradient Boosting (XGBoost) ................................ ................................ ............ 22 3.6. K-means ................................ ................................ ................................ .............. 25
4. Resultados ......................................................................................................... 28
5. Conclusiones .................................................................................................... 32
6. Referencias ....................................................................................................... 332
1. Introducción
Las tareas de monitoreo y supervisión de los mercados no tienen únicamente como objetivo verificar el cumplimiento normativo, sino también preservar la transparencia, la formación eficiente de precios y la confianza de los participantes e inversionistas. En el caso colombiano, el mercado de deuda pública emitida por el gobierno nacional central (mercado de TES) además de ser una alternativa de inversión en renta fija, juega un papel fundamental en la transmisión de la política monetaria, la gestión de la deuda del Gobierno y la generación de curvas de referencia para la negociación de otros activos financieros.
A medida que los mercados evolucionan en función de las capacidades tecnológicas disponibles y se vuelven más líquidos y complejos, el volumen de información disponible crece de manera exponencial: miles de cotizaciones, operaciones y órdenes se generan cada día , haciendo que el análisis de estos datos solo con herramientas tradicionales result e cada vez más difícil. Al mismo
información disponible crece de manera exponencial: miles de cotizaciones, operaciones y órdenes se generan cada día , haciendo que el análisis de estos datos solo con herramientas tradicionales result e cada vez más difícil. Al mismo tiempo, los episodios de alta volatilidad, la aparición de nuevas estrategias de negociación y la posibilidad de errores operativos o prácticas abusivas hacen necesario contar con mecanismos de alerta temprana más sofisticados.
Generalmente, las herramientas de monitoreo enfocada s en el análisis de la formación de precios se basan en técnicas relativamente s encillas como los canales de precios, cuya construcción se basa en el comportamiento reciente del mercado en términos de valores promedio y volatilidad . Estas metodologías han sido útiles, en especial por su transparencia y facilidad de compresión, sin embargo, presentan algunas limitaciones cuando se enfrentan a patrones de comportamiento más complejos, cambios bruscos en las condiciones del mercado (aumentos significativos en los niveles de volatilidad) o interacciones entre múltiples variables.
En este contexto, las técnicas de Machine Learning (ML) se presentan como un conjunto de herramientas muy poderosas para tareas como la detección de anomalías, la identificación de conductas inusuales, el análisis de riesgo y la predicción de variables financieras. De manera general, estos algoritmos permiten “aprender” patrones a partir de grandes volúmenes de datos y, con base en ellos, emitir alertas cuando una observación nueva se aparta de lo habitual.3 AMV no es ajeno a esta realidad y con el propósito de evolucionar al ritmo que lo hace los mercados y en un proceso de innovación y mejora continua, ha iniciado
emitir alertas cuando una observación nueva se aparta de lo habitual.3 AMV no es ajeno a esta realidad y con el propósito de evolucionar al ritmo que lo hace los mercados y en un proceso de innovación y mejora continua, ha iniciado el desarrollo de herramientas de monitoreo que incorporan el uso de algoritmos de Machine Learning, empezando con la negociación de deuda pública, que, dado su tamaño y particularidades señaladas previamente , lo convierten en un pilar fundamental para el desarrollo de los mercados locales.
El objetivo de este documento es, a partir de la experiencia del autorregulador en el uso de estas metodologías en sus labores de análisis diarias, presentar de manera clara y accesible, los elementos generales d el uso de algoritmos de Machine Learning en la construcción de herramientas de monitoreo, particularmente para el mercado de deuda pública, con énfasis en la identificación de operaciones cuyos precios se alejan de los patrones normales de negociación.
Para ello, en el primer capítulo se describe n los mecanismos tradicionales empleados para la identificación de precios alejados de los promedios de negociación, dando especial énfasis al funcionamiento, ventajas y limitaciones de los canales de precios. En el segundo capítulo se explican los aspectos metodológicos de algunos de los algoritmos de Machine Learning más empleados (Support Vector Machines, Random Forest , Redes Neuronales tipo MLP, Isolation Forest, Gradient Boosting –XGBoost– y K -means), luego en el tercer capítulo se presentan los resultados empíricos de la aplicación de estos métodos al mercado de deuda pública y se define cuál de ellos se ajusta de mejor manera a la identificación de operaciones alejadas de los promedios de negociación . Por último, se presentan algunas conclusiones.4
de deuda pública y se define cuál de ellos se ajusta de mejor manera a la identificación de operaciones alejadas de los promedios de negociación . Por último, se presentan algunas conclusiones.4
2. Métodos tradicionales – los canales de precios
En la negociación de los diferentes mercados, c ada operación refleja el acuerdo entre un comprador y un vendedor sobre el precio (o rendimiento) al cual están dispuestos a intercambiar un activo (acción, bono, contrato de futuros estandarizado, etc.) . Sin embargo, no todas las operaciones son igualmente representativas del estado general del mercado, algunas pueden corresponder a montos muy pequeños, a errores operativos, a negociaciones en momentos de muy baja liquidez o, en casos extremos, a conductas potencialmente abusivas.
Para que el monitoreo sea efectivo, es necesario contar con una referencia de precio que resuma, en cada momento, el nivel alrededor del cual se están concretando las operaciones que pueden considerarse típicas. A partir de esa referencia, se pueden identificar negociaciones que se alejan significativamente del comportamiento general y que, por lo tanto, ameritan una revisión más detallada por parte de l supervisor . Con este objetivo, se emplean instrumentos como los canales de precios.
Los canales de precios son una herramienta que construye una banda alrededor de un precio central , e sa banda define un rango de precios considerados “normales” dadas las condiciones recientes del mercado. En su versión más simple, el canal se construye a partir de:
- Un precio de referencia, usualmente calculado como un promedio ponderado por monto de las operaciones más recientes. • Una medida de volatilidad, que refleja qué tanto fluctúan típicamente los precios alrededor de ese promedio.
- Un precio de referencia, usualmente calculado como un promedio ponderado por monto de las operaciones más recientes. • Una medida de volatilidad, que refleja qué tanto fluctúan típicamente los precios alrededor de ese promedio. • Un factor de amplitud, que determina qué tan amplia será la banda, es decir, cuántas “veces la volatilidad” se permite que el precio se aleje del promedio antes de considerarse atípico.
Desde un punto de vista práctico, el canal de precios para un TES específico en una ventana determinada se puede construir siguiendo estos pasos:5 Paso 1. Selección de operaciones relevantes : Se define una ventana de tiempo (por ejemplo, las últimas N operaciones o los últimos M minutos) y se seleccionan las operaciones de compra y venta de un TES específico que cumplan ciertos criterios mínimos de calidad (por ejemplo, excluir operaciones con montos muy bajos o registradas en condiciones especiales).
Paso 2. Cálculo de la tasa1 de referencia: con las operaciones seleccionadas, se calcula la tasa de referencia como un promedio ponderado por monto:
𝑇𝑎𝑠𝑎 𝑑𝑒 𝑟𝑒𝑓𝑒𝑟𝑒𝑛𝑐𝑖𝑎 = ∑(𝑡𝑎𝑠𝑎𝑖 ∗ 𝑚𝑜𝑛𝑡𝑜𝑖) ∑ 𝑚𝑜𝑛𝑡𝑜𝑖
Donde 𝑡𝑎𝑠𝑎𝑖 es la tasa de la operación 𝑖 y 𝑚𝑜𝑛𝑡𝑜𝑖 es el monto transado en esa
Donde 𝑡𝑎𝑠𝑎𝑖 es la tasa de la operación 𝑖 y 𝑚𝑜𝑛𝑡𝑜𝑖 es el monto transado en esa operación. De esta forma, las transacciones de mayor tamaño tienen un peso más alto en la formación de la tasa de referencia.
Paso 3. Cálculo de los rendimientos y la volatilidad 2 (EWMA): Para medir la volatilidad, en lugar de usar una simple desviación estándar de tod as las tasas, es frecuente utilizar un esquema de media móvil exponencial (EWMA por sus siglas en inglés). En este enfoque, las observaciones más recientes tienen un mayor peso que las más antiguas , lo que da más importancia a la dinámica más reciente del mercado.
De manera práctica, primero se calculan los rendimientos o cambios porcentuales de un período a otro, por ejemplo, si 𝑝𝑡 es la tasa de referencia en el momento t, se define el rendimiento como:
𝑟𝑡 = 𝑝𝑡 − 𝑝𝑡−1
Luego, la varianza condicional en el tiempo t, denotada 𝜎𝑡 2, se actualiza de forma recursiva como:
1 Si bien hablamos del método de canales de precios, en el caso particular del mercado de TES, el canal y análisis se hacen con relación a las tasas de negociación, puesto que en el mercado colombiano los títulos de renta fija se negocian con base en su tasa y no en el precio. 2 La volatilidad utilizada en un canal de precios puede calcularse mediante distintos enfoques, tales como desviación estándar histórica, volatilidad exponencialmente ponderada (EWMA), modelos
se negocian con base en su tasa y no en el precio. 2 La volatilidad utilizada en un canal de precios puede calcularse mediante distintos enfoques, tales como desviación estándar histórica, volatilidad exponencialmente ponderada (EWMA), modelos ARCH/GARCH/EGARCH, aproximaciones estocásticas o estimadores de rango intradía, dependiendo del nivel de sensibilidad y robustez buscado, así como de las posibilidades de cómputo para realizar este tipo de cálculos de manera recurrente.6
𝜎𝑡 2 = 𝜆 ∗ 𝜎𝑡−1 2 + (1 − 𝜆) ∗ 𝑟𝑡−1 2
donde 𝜆 es un parámetro entre 0 y 1 que controla qué tanto se pondera la información pasada. Valores de 𝜆 cercanos a 1 generan una volatilidad más estable (menos sensible a movimientos recientes), mientras que valores más bajos hacen que la volatilidad responda más rápidamente a nuevos datos. La desviación estándar 𝜎𝑡, se obtiene como la raíz cuadrada de la varianza 𝜎𝑡 2.
Paso 4. Construcción del canal (bandas de precios): con el precio de referencia y la volatilidad estimada, se define el canal de precios a partir de una regla del tipo:
Límite superior
𝑇𝑎𝑠𝑎 𝑑𝑒 𝑟𝑒𝑓𝑒𝑟𝑒𝑛𝑐𝑖𝑎 ∗ (1 + 𝑘 ∗ 𝜎𝑡)
Límite inferior
Límite inferior
𝑇𝑎𝑠𝑎 𝑑𝑒 𝑟𝑒𝑓𝑒𝑟𝑒𝑛𝑐𝑖𝑎 ∗ (1 − +𝑘 ∗ 𝜎𝑡)
Donde 𝑘 es un factor de amplitud (por ejemplo, 2 o 3) 3, cuanto mayor es 𝑘, más ancho es el canal y menos operaciones se marcan como atípicas.
Paso 5. Identificación de operaciones atípicas: cada nueva operación se compara con los límites del canal. Si el precio está dentro de la banda, se considera consistente con el comportamiento reciente del mercado, pero si el precio está por encima del límite superior o por debajo del límite inferior, se genera una alerta sobre una transacción alejada de los valores promedio de negociación para el momento de su realización.
En la práctica, la construcción de canales de precios implica tomar varias decisiones de diseño, entre las que se destacan:
- Longitud de la ventana de cálculo: qué tan atrás se miran las operaciones para calcular la tasa de referencia y la volatilidad. Ventanas muy cortas pueden
3 La definición de este factor de amplitud debe partir del análisis de la distribución de los retornos, de tal forma que me permita identificar las operaciones que se ubiquen en las colas de dicha distribución y que corresponden a valores poco frecuentes o atípicos.7 hacer que el canal sea demasiado sensible a pocos datos; ventanas muy largas pueden hacerlo demasiado “lento” para reaccionar.
- Parámetro 𝝀 de la EWMA: determina el peso relativo de la historia lejana frente a las observaciones recientes , su elección afecta la rapidez con la que la
pueden hacerlo demasiado “lento” para reaccionar.
- Parámetro 𝝀 de la EWMA: determina el peso relativo de la historia lejana frente a las observaciones recientes , su elección afecta la rapidez con la que la medida de volatilidad se ajusta ante cambios bruscos del mercado.
- Factor de amplitud 𝒌: define el nivel de tolerancia a desviaciones respecto al promedio, valores pequeños de 𝑘 generan más alertas (más sensibilidad, pero también más falsos positivos); valores grandes de 𝑘 reducen el número de alertas, pero pueden dejar pasar operaciones relevantes.
- Segmentación por tipo de instrumento y madurez : dado que la volatilidad y la liquidez pueden ser diferentes para las distintas referencias de TES (por ejemplo, títulos benchmark frente a referencias menos líquidas), es usual calibrar los parámetros de forma diferenciada.
- Frecuencia de actualización: los canales pueden recalcularse de manera continua (cada nueva operación) o en intervalos regulares (cada cierto número de operaciones o cada cierto tiempo).
Siendo un método de análisis de operaciones ampliamente utilizado, a continuación, se enuncian las principales ventajas y limitaciones de la implementación de los canales de precios:
Ventajas Limitaciones
Simplicidad: su lógica es intuitiva, es relativamente fácil explicar cómo se construyen y por qué una operación es marcada como atípica.
Reacción lenta: cuando la volatilidad aumenta de manera súbita, la medida basada en EWMA puede tardar en ajustarse. En ese periodo de transición, el canal puede resultar demasiado estrecho, generando un número elevado de falsos
aumenta de manera súbita, la medida basada en EWMA puede tardar en ajustarse. En ese periodo de transición, el canal puede resultar demasiado estrecho, generando un número elevado de falsos positivos.
Supuesto implícito de comportamiento “regular”: el canal se apoya en la idea de que los precios fluctúan alrededor de un8
Transparencia: los parámetros pueden explicarse con claridad, lo cual favorece la comprensión de las reglas de supervisión. promedio de forma relativamente estable.
En presencia de cambios estructurales, esta aproximación puede ser insuficiente.
Bajo costo computacional: los cálculos necesarios (promedios, varianzas, actualizaciones EWMA) son sencillos y se pueden implementar fácilmente en tiempo real.
Enfoque univariado: el canal se construye típicamente considerando solo el precio
(o rendimiento) de un título, sin incorporar otras variables relevantes, esto limita su capacidad para distinguir entre operaciones atípicas pero justificadas y operaciones que realmente merecen una alerta.
Estabilidad: en condiciones normales de mercado, los canales tienden a generar un número razonable de alertas, evitando una sobrecarga en la revisión de los resultados.
Sensibilidad a la iliquidez: en títulos o momentos de baja negociación, el cálculo de la tasa de referencia puede basarse en muy pocas operaciones, lo que reduce la confiabilidad de la banda.
Dificultad para capturar patrones complejos: los canales de precios no están diseñados para reconocer patrones en el
cálculo de la tasa de referencia puede basarse en muy pocas operaciones, lo que reduce la confiabilidad de la banda.
Dificultad para capturar patrones complejos: los canales de precios no están diseñados para reconocer patrones en el tiempo (por ejemplo, secuencias de operaciones) ni interacciones entre múltiples variables, por lo que ciertas conductas inusuales pueden pasar desapercibidas.
A pesar de sus ventajas, los canales de precios presentan varias limitaciones que motivan la búsqueda de alternativas más flexibles, e stas limitaciones, sumadas al creciente volumen y riqueza de los datos disponibles, hacen plausible y deseable explorar herramientas más avanzadas, como los algoritmos de Machine Learning, que permiten modelar de forma conjunta múltiples variables y detectar anomalías de manera más sofisticada.9
3. Aspectos metodológicos – algoritmos de
Machine Learning
El Machine Learning es una rama de la inteligencia artificial que permite que los computadores aprendan patrones a partir de los datos, sin necesitar que cada instrucción sea programada de forma explícita. En lugar de seguir reglas fijas, los algoritmos de Machine Learning analizan grandes volúmenes de información, identifican relaciones entre variables y utilizan ese aprendizaje para hacer predicciones, clasificar nuevas observaciones o detectar comportamientos inusuales. Su principal ventaja es que pueden adaptarse cuando cambian los datos o las condiciones del entorno, lo que los hace especialmente útiles en contextos complejos y dinámicos, como los mercados financieros.
Dentro del amplio conjunto de herramientas que ofrece el Machine Learning, los algoritmos pueden clasificarse según la manera en que aprenden a partir de los datos, esta distinción da lugar a dos grandes enfoques: los algoritmos supervisados,
Dentro del amplio conjunto de herramientas que ofrece el Machine Learning, los algoritmos pueden clasificarse según la manera en que aprenden a partir de los datos, esta distinción da lugar a dos grandes enfoques: los algoritmos supervisados, que aprenden a partir de hechos ya conocidos , y los algoritmos no supervisados, que descubren estructuras o anomalías directamente a partir de los datos. Comprender esta diferencia es fundamental para seleccionar la metodología adecuada según los objetivos del análisis y la disponibilidad de información en cada caso.
- Algoritmos supervisados: son aquellos que aprenden a partir de ejemplos en los que ya se conoce la respuesta correcta, esto significa que el modelo recibe un conjunto de datos históricos que incluyen tanto las características de cada observación (para el caso que nos interesa, cada observación corresponde a una operación y sus características a elementos como tasa, monto, distancia de los valores promedio, hora de la transacción, etc. ) como la etiqueta asociada (por ejemplo, si la operación fue normal o atípica).
Con esta información, el algoritmo aprende a reconocer patrones y a relacionar las características con las etiquetas. Una vez entrenado, puede predecir la etiqueta de nuevas observaciones. Algunos ejemplos típicos de este tipo de algoritmos son: la clasificación de correos spam/no spam, la detección de fraudes etiquetados y los modelos de riesgo de crédito.10 • Algoritmos no supervisados : trabajan con datos que no tienen etiquetas o respuestas predefinidas , su objetivo es descubrir estructuras, agrupaciones o patrones ocultos directamente a partir de los datos. En este caso, el modelo no sabe de antemano qué observaciones son normales o anómalas , debe
respuestas predefinidas , su objetivo es descubrir estructuras, agrupaciones o patrones ocultos directamente a partir de los datos. En este caso, el modelo no sabe de antemano qué observaciones son normales o anómalas , debe identificar, por sí mismo, qué combinaciones de características son frecuentes y cuáles son inusuales.
Estos métodos son especialmente útiles cuando no existen registros históricos que indiquen claramente qué casos son problemáticos. Algunos usos frecuentes de este tipo de algoritmos son: el agrupamiento (clustering), la detección de outliers y la segmentación de clientes.
A continuación, se describen de manera general los algoritmos de uso más habitual y que corresponden a aquellos empleados por AMV en sus análisis para la definición de la mejor opción de implementación en la identificación de operaciones alejadas de los promedios de negociación en el mercado de TES.
3.1. Support Vector Machines (SVM)
Esta es una familia de algoritmos de Machine Learning que busca separar datos en distintas categorías mediante la construcción de una frontera óptima entre ellos. La idea central es encontrar una línea, plano o hiperplano que divida los datos de la mejor manera posible, dejando a cada lado las observaciones que pertenecen a clases diferentes. Esta frontera se elige de forma que la separación entre las clases sea lo más amplia posible, lo que hace que el modelo sea robusto frente al ruido y a pequeñas variaciones en los datos.
Cuando los datos no pueden separarse fácilmente mediante una línea recta o un plano, SVM utiliza funciones conocidas como kernels4, que permiten transformar los datos a un espacio de mayor dimensión donde sí es posible encontrar una frontera clara. Gracias a esta capacidad, SVM puede capturar relaciones complejas y no lineales entre las variables.
plano, SVM utiliza funciones conocidas como kernels4, que permiten transformar los datos a un espacio de mayor dimensión donde sí es posible encontrar una frontera clara. Gracias a esta capacidad, SVM puede capturar relaciones complejas y no lineales entre las variables.
4 Un kernel es una función matemática que permite a ciertos algoritmos, como los SVM, transformar los datos a un espacio de mayor dimensión para identificar fronteras de separación más complejas entre las observaciones, sin necesidad de realizar explícitamente dicha transformación. Es decir, Un kernel permite que los algoritmos “vean” los datos desde otra perspectiva, en un espacio donde las diferencias o separaciones entre grupos son más fáciles de identificar.11 En tareas de supervisión de mercados o detección de anomalías suele emplearse una variante llamada one-class SVM , que se entrena únicamente con datos considerados normales. El algoritmo aprende la “forma” o el espacio que ocupan estas observaciones y, posteriormente, identifica como atípicas aquellas que quedan fuera de esa región. Esto lo hace especialmente útil en contextos donde se tiene abundancia de datos normales pero pocos casos etiquetados como irregulares.
En conjunto, SVM es un método flexible, sólido y capaz de manejar relaciones complejas entre variables, lo que lo convierte en una herramienta valiosa tanto para clasificación tradicional como para detección de comportamientos inusuales en mercados financi eros. A continuación , se presenta el paso a paso de la implementación de este algoritmo.
Etapa Descripción
1. Selección de variables
(características) Se define el conjunto de características que describen cada operación de TES (Desviación del precio frente a la curva, monto, hora, volatilidad, etc.). Así, cada
Etapa Descripción
1. Selección de variables
(características) Se define el conjunto de características que describen cada operación de TES (Desviación del precio frente a la curva, monto, hora, volatilidad, etc.). Así, cada operación queda representada como un vector de números.
𝑥 = {𝑥1, 𝑥2, 𝑥3, … , 𝑥𝑛}
2. Etiquetado de observaciones Para entrenar un SVM supervisado, se necesita que una parte de las operaciones históricas esté etiquetada, por ejemplo: • y = 0 → operación normal • y = 1 → operación atípica / de interés de supervisión
3. Escalamiento de datos Para que ninguna variable domine a las demás por su escala (por ejemplo, montos muy grandes frente a porcentajes pequeños), se realiza un “reescalamiento”
(normalización o estandarización). Típicamente:
𝑥𝑗 ′ = 𝑥𝑗 − 𝜇𝑗 𝜎𝑗12
4. Elección del tipo de SVM y del kernel El SVM puede trabajar con distintas formas de frontera: • Lineal: si los datos se separan razonablemente con un plano. • No lineal: usando un kernel (por ejemplo, RBF5) que permite encontrar fronteras curvas en espacios de mayor dimensión.
5. Entrenamiento del modelo El SVM resuelve un problema de optimización cuyo objetivo es: • Encontrar la frontera que mejor separe las clases. • Maximizar la distancia (margen) entre la frontera y los puntos más cercanos de cada clase (los llamados support vectors).
modelo El SVM resuelve un problema de optimización cuyo objetivo es: • Encontrar la frontera que mejor separe las clases. • Maximizar la distancia (margen) entre la frontera y los puntos más cercanos de cada clase (los llamados support vectors). • Penalizar errores de clasificación según un parámetro de regularización (C). • De manera intuitiva lo que hace es a partir de la información histórica de datos ya etiquetados, buscar una línea/frontera tal que deje los puntos de una clase a un lado y los de la otra al otro lado, con la mayor distancia posible, permitiendo algunos errores si con eso gano robustez.
6. Validación y calibración Se prueba el modelo con un conjunto de datos de validación no empleados en el entrenamiento, que incluyan operaciones previamente catalogadas como atípicas, y se ajustan parámetros para lograr un balance adecuado entre falsas alarmas y omisiones.
7. Uso en producción Cada nueva operación se transforma (con las mismas reglas de escalamiento) y se evalúa con el SVM. Si cae dentro de la región aprendida, se considera normal; si cae por fuera, se marca como posible anomalía.
5 El kernel RBF (Radial Basis Function) es una función que mide la similitud entre dos observaciones en función de la distancia entre ellas (distancia euclidiana), permitiendo que algoritmos como los SVM identifiquen fronteras no lineales al proyectar los datos en un espacio de mayor dimensión.13 Figura 1. Ilustración de clasificación binaria por SVM
Fuente: www.towardsdatascience.com
Una vez entendido el funcionamiento general del algoritmo y los pasos
Figura 1. Ilustración de clasificación binaria por SVM
Fuente: www.towardsdatascience.com
Una vez entendido el funcionamiento general del algoritmo y los pasos involucrados en su entrenamiento y aplicación, resulta importante evaluar qué tan adecuado es este enfoque para tareas de monitoreo de mercados. Como ocurre con cualquier metodología, lo s SVM presentan fortalezas que los hacen especialmente útiles en ciertos contextos, así como limitaciones que deben considerarse al momento de implementarlos en la práctica. A continuación , se describen las principales ventajas y desventajas de este tipo d e modelos en el análisis de operaciones financieras.
Ventajas Limitaciones Manejo de alta dimensión: puede trabajar con muchas variables al mismo tiempo sin perder eficacia.
Sensibilidad a la calibración: requiere ajustar cuidadosamente parámetros como el kernel y el nivel de tolerancia a errores, lo cual puede ser complejo.
Flexibilidad: gracias al uso de kernels, puede capturar relaciones no lineales entre las variables.
Costo computacional: para conjuntos de datos muy grandes, el entrenamiento puede ser costoso en tiempo y memoria.
Enfoque específico para anomalías: la variante one-class SVM está diseñada precisamente para escenarios donde se tiene mucha información de datos normales y pocas etiquetas de anomalías.
Menor interpretabilidad: no siempre es sencillo explicar de forma intuitiva por qué una operación específica fue clasificada como anómala.14
3.2. Random Forest
Antes de abordar el concepto de Bosque Aleatorio, es necesario comprender que su unidad constitutiva es el árbol de decisión . este es un modelo de Machine
una operación específica fue clasificada como anómala.14 3.2. Random Forest
Antes de abordar el concepto de Bosque Aleatorio, es necesario comprender que su unidad constitutiva es el árbol de decisión . este es un modelo de Machine Learning que clasifica observaciones siguiendo una serie de reglas simples organizadas en forma de estructura jerárquica similar a un árbol. En cada nodo del árbol (la base de una rama), el algoritmo evalúa una condición basada en alguna característica del dato , por ejemplo, si el monto de una operación es mayor o menor que un cierto valor y, según el resultado, dirige la observación a una rama u otra.
Este proceso continúa hasta llegar a un nodo final o hoja, donde se asigna una clasificación o predicción. Los árboles de decisión permiten capturar relaciones no lineales entre variables, lo que los convierte en bloques fundamentales para este tipo de métodos.
Figura 2. Ilustración de un árbol de decisión
Fuente: www.algodaily.com
Random Forest es un algoritmo de Machine Learning basado en el uso conjunto de múltiples árboles de decisión para mejorar la precisión y la robustez de las predicciones. En lugar de depender de un único árbol que puede ser sensible al ruido o a particularidades de los datos , Random Forest construye muchos árboles, cada uno entrenado con muestras diferentes de los datos y con subconjuntos aleatorios de variables. Este proceso, conocido como “ensamble”, hace que los árboles aprendan patrones complementarios entre sí.15
Cuando se analiza una nueva observación, cada árbol emite su propia clasificación o estimación, y el algoritmo combina todas estas respuestas para
árboles aprendan patrones complementarios entre sí.15
Cuando se analiza una nueva observación, cada árbol emite su propia clasificación o estimación, y el algoritmo combina todas estas respuestas para obtener un resultado final, generalmente mediante un voto mayori