Cuando se estudia en inteligencia artificial el aprendizaje por refuerzo, uno de los conceptos básicos es el problema “multi-armed bandits”, o el problema de las tragamonedas de los múltiples brazos. Mas allá del raro nombre (en inglés tiene más sentido) el problema plantea que hacer para escoger la mejor alternativa entre una serie de opciones, esto en el caso que uno tenga varias oportunidades de elegir y cambiar de opción (algo parecido a la vida cuando escogemos un camino a seguir pero siempre dudamos si estamos en el camino correcto). La solución más eficiente para llegar a la mejor solución posible es llamada “el dilema de exploración o explotación” y va de que hay una fase inicial de exploración donde debe darse licencia de probar las diferentes alternativas posibles, luego de eso ponderarlas y escoger una.
Lo que no se mide, no mejora. Es una básica en ingeniería y en multitud de ciencias, y agregaría, lo que se mide mal, siempre empeora.