Imaginemos que una empresa quiere vender más.
No puede medir algo tan abstracto como «hacer bien el trabajo comercial», así que elige una señal más sencilla.
Llamadas.
Tiene sentido.
Si hablamos con más clientes potenciales, probablemente aparecerán más oportunidades.
El equipo recibe un objetivo.
Cien llamadas.
Pasan unas semanas.
Las llamadas suben.
Mucho.
El dashboard se pone verde.
Las ventas, en cambio, apenas se mueven.
Cuando alguien mira un poco más de cerca descubre conversaciones más cortas, contactos repetidos y llamadas que podrían haber sido un correo.
No hace falta que nadie haya decidido hacer trampas.
El equipo ha aprendido qué puntúa.
Queríamos ventas.
Medimos llamadas.
Después gestionamos llamadas.
Y terminamos consiguiendo exactamente eso.
Llamadas.
El ejemplo es inventado.
El mecanismo no.
Medir es construir una representación
Estoy bastante obsesionado con medir cosas.
Si algo cabe en una tabla, inmediatamente me parece un poco más manejable.
Facturación, margen, conversión, productividad, satisfacción, calidad, riesgo, aprendizaje.
El problema es que muchas de esas cosas no existen como un número esperando a que vayamos a recogerlo.
Tenemos que construir el número.
La satisfacción de un cliente no vive en una columna.
Preguntamos. Creamos una escala. Miramos recurrencia, cancelaciones, reclamaciones, recomendaciones.
Cada señal captura una parte.
Ninguna es «la satisfacción».
Incluso algo que parece tan objetivo como ventas obliga a decidir qué contamos.
¿Pedido? ¿Factura? ¿Cobro? ¿Ingreso reconocido?
Medir es comprimir.
Cogemos una realidad con demasiadas dimensiones y construimos algo más pequeño para poder observarla y actuar.
Eso no es un defecto.
Es exactamente para lo que sirve una métrica.
El mapa necesita ser más simple que el territorio o deja de ser un mapa.
El problema empieza cuando olvidamos que era un mapa.
Una métrica deja de ser espectadora cuando produce consecuencias
La idea que solemos llamar ley de Goodhart se resume a menudo con una frase muy conocida:
Cuando una medida se convierte en objetivo, deja de ser una buena medida.
La formulación popular aparece asociada a Marilyn Strathern, que escribió sobre auditoría universitaria en 1997. Goodhart había formulado antes un problema más específico en política monetaria: una regularidad estadística puede dejar de comportarse igual cuando se utiliza activamente con fines de control.
No me interesa demasiado quién merece la camiseta con la frase.
Me interesa el giro conceptual.
Antes de fijar llamadas como objetivo, quizá las personas que llamaban más también vendían más.
La relación podía contener información.
Después convertimos la relación en regla.
Añadimos consecuencias.
Bonus.
Evaluación.
Presión.
Y el sistema cambia.
Ya no estamos observando exactamente el mismo mundo que observábamos antes.
Hemos entrado dentro.
Donald Campbell llegó a una preocupación parecida desde la evaluación de políticas públicas: cuanto más peso adquieren determinados indicadores en procesos de evaluación y decisión, mayor es el riesgo de que los propios procesos respondan a esa medición.
La palabra que me interesa es presión.
Porque evita convertir toda esta historia en una discusión sobre gente tramposa.
Los incentivos también hablan
Una empresa puede decir que quiere calidad y premiar velocidad.
Puede decir que quiere colaboración y promocionar individualmente por ventas.
Puede decir que quiere aprendizaje y convertir una nota en la consecuencia más importante de todo el curso.
Puede decir que quiere relaciones a largo plazo y premiar únicamente contratos cerrados este mes.
Las declaraciones expresan una intención.
Los incentivos expresan otra arquitectura.
Y las arquitecturas suelen ganar.
No siempre porque las personas sean cínicas.
A veces porque tienen que decidir dónde poner su tiempo.
Si un comportamiento produce consecuencias y otro no, el sistema está diciendo algo.
Puedes escribir valores en la pared.
El bonus sigue hablando.
El sistema aprende cómo funciona el marcador
Hay ejemplos clásicos que muestran este problema fuera de la empresa.
Brian Jacob y Steven Levitt estudiaron manipulación de pruebas estandarizadas en escuelas públicas de Chicago y estimaron casos graves en un mínimo del 4–5% de las aulas de primaria analizadas anualmente. Más interesante para este artículo: observaron que la frecuencia respondía a cambios relativamente pequeños en los incentivos.
Gwyn Bevan y Christopher Hood analizaron sistemas de objetivos en la sanidad pública inglesa y encontraron la misma tensión entre aquello que se mide, aquello que se pretende mejorar y las conductas que aparecen cuando una parte medible pasa a representar al conjunto.
No necesito convertir estos estudios en una demostración de que todo KPI acaba corrompido.
No dicen eso.
Me basta con algo menos espectacular.
Cuando una medida produce consecuencias, las personas incorporan la medida a la realidad sobre la que deciden.
El examen ya no observa únicamente aprendizaje si un futuro profesional depende de él.
El tiempo de espera deja de ser solo una descripción cuando cruzar un umbral produce una sanción.
Un KPI comercial deja de ser solo una ventana cuando determina el bonus.
El instrumento entra en el sistema.
Y el sistema aprende que está ahí.
No hace falta engañar para romper un indicador
Esta es la parte que más me interesa porque elimina la salida moral fácil.
Podríamos pensar que Goodhart significa:
cuando pones una métrica, alguien intenta hacer trampas.
No necesariamente.
David Manheim y Scott Garrabrant distinguen distintas formas en las que un proxy puede dejar de representar bien aquello que pretendíamos optimizar. Algunas incluyen comportamiento estratégico. Otras aparecen simplemente porque empujamos una relación más allá de las condiciones en las que funcionaba.
Volvamos a las llamadas.
Observamos que los mejores comerciales llaman más.
Concluimos que debemos aumentar llamadas.
Pero quizá llaman más porque identifican mejor oportunidades.
Quizá la experiencia explica ambas cosas.
Quizá hacer más llamadas ayuda hasta cierto punto y después deja de aportar.
Quizá, cuando obligamos a todo el mundo a llegar a cien, cambia lo que significa «una llamada».
La métrica podía ser útil para describir.
Eso no significa que maximizarla sea una palanca causal infinita.
Aquí nadie ha hecho trampas.
Solo teníamos un modelo demasiado simple.
Una métrica puede fallar aunque todo el mundo actúe de buena fe.
El dashboard no está fuera de la empresa
Solemos imaginar un dashboard como una ventana.
La empresa ocurre fuera.
Nosotros la observamos mediante datos.
realidad → datos → dashboard
Pero en cuanto utilizamos el dashboard para gestionar, el flujo cambia.
Miramos el número.
Tomamos una decisión.
Introducimos una prioridad.
El equipo adapta su comportamiento.
Ese comportamiento modifica los datos.
Los nuevos datos vuelven a la pantalla.
La estructura se parece más a esto:
realidad → datos → dashboard → decisiones → comportamiento → nueva realidad
El instrumento con el que observamos empieza a participar en aquello que observa.
Esto me parece mucho más importante que discutir si necesitamos cinco KPIs o veinte.
Diseñar métricas también es diseñar organización.
Decidimos qué aparece en una reunión. Qué se pone en rojo. Qué merece explicación. Qué obtiene presupuesto. Qué comportamiento recibe reconocimiento.
Y, por supuesto, qué cosas quedan fuera porque no caben en la pantalla.
Un dashboard organiza la mirada.
La mirada organiza atención.
La atención acaba organizando parte del comportamiento.
La precisión puede producir una falsa sensación de realidad
Hay algo hipnótico en un número con dos decimales.
Satisfacción del cliente:
73,42.
Parece una propiedad física.
Pero antes de llegar al 73,42 alguien tuvo que decidir qué significa satisfacción.
A quién preguntar. Cuándo. Cómo. Qué respuestas contar. Cómo agregarlas. Qué peso dar a cada dimensión.
El número llega limpio.
La discusión que lo produjo desaparece.
Eso ocurre con casi todos nuestros sistemas de representación.
La categoría final parece más sólida que el proceso que la construyó.
«Cliente activo».
«Lead cualificado».
«Empleado productivo».
«Riesgo alto».
«Contenido de calidad».
Cada categoría facilita una decisión.
También borra matices.
Y no podemos evitarlo por completo.
Necesitamos categorías.
El error es olvidar que alguien decidió dónde estaba el borde.
Entonces llegó la inteligencia artificial y escribimos el problema en código
Aquí la comparación se vuelve especialmente interesante.
No porque una empresa y un agente de aprendizaje por refuerzo sean lo mismo.
No lo son.
Pero comparten una dificultad.
Nuestra intención es más rica que la señal con la que intentamos expresarla.
En aprendizaje automático podemos construir una función de recompensa.
El sistema aprende a conseguir más recompensa.
Perfecto.
Hasta que descubre una manera de aumentar la señal que nosotros no habíamos asociado con el comportamiento deseado.
El trabajo Concrete Problems in AI Safety, publicado en 2016 por Dario Amodei y otros investigadores, incluyó el reward hacking entre los problemas prácticos derivados de objetivos mal especificados.
La máquina no necesita odiarnos.
No necesita querer engañarnos.
No necesita rebelarse.
Está optimizando.
Ese era el trabajo.
Y ahí la historia vuelve a parecerse sospechosamente al comercial que ha aprendido cómo puntúa el dashboard.
Reward hacking es Goodhart con esteroides
Vale.
La frase es una exageración.
Me gusta precisamente porque aterriza la intuición.
No estoy diciendo que reward hacking y la ley de Goodhart sean el mismo fenómeno.
Tampoco que una persona respondiendo a un bonus y un algoritmo optimizando una función de recompensa funcionen igual.
La comparación apunta a otra cosa.
La cantidad de presión que podemos aplicar sobre el proxy.
Un equipo puede aprender a jugar con su KPI.
Un sistema diseñado para optimizar puede explorar estrategias a una escala completamente distinta.
Y cuanto mejor sea encontrando maneras de mejorar la señal, más importantes se vuelven los agujeros de nuestra definición.
Le pedimos precisamente que descubra soluciones que nosotros no habíamos imaginado.
Después nos sorprende que descubra también interpretaciones que nosotros no habíamos imaginado.
No es una traición.
Es un problema de especificación.
Los modelos de lenguaje vuelven a cerrar el bucle
Esto se vuelve todavía más extraño cuando un modelo no se limita a responder una pregunta.
Actúa.
Observa qué ocurrió.
Vuelve a actuar.
Alexander Pan y sus colaboradores estudiaron en 2024 bucles de feedback con modelos de lenguaje y mostraron cómo podían aparecer comportamientos de in-context reward hacking. Uno de sus ejemplos es sencillo: un agente orientado a aumentar engagement puede observar que determinado contenido genera más interacción y volver progresivamente sus publicaciones más controvertidas.
La estructura me resulta familiar.
Acción.
Métrica.
Nueva decisión.
Nueva acción.
Es nuestro dashboard otra vez.
Solo que el bucle puede recorrerlo una máquina miles de veces.
Eso cambia la escala.
No cambia la pregunta.
¿La señal que estamos mejorando sigue representando aquello que queríamos conseguir?
La IA no inventó el problema
Hablamos de alineamiento de inteligencia artificial como si la humanidad acabara de descubrir una pregunta completamente nueva.
¿Cómo conseguimos que una máquina haga lo que realmente queremos y no solo lo que hemos conseguido especificar?
Es una pregunta enorme.
Pero tiene familiares antiguos.
¿Cómo conseguimos que una empresa persiga aquello que dice valorar y no únicamente aquello por lo que paga?
¿Cómo conseguimos que una escuela enseñe y no solo prepare para una prueba?
¿Cómo conseguimos que una política pública mejore el fenómeno real y no únicamente el indicador que auditamos?
¿Cómo conseguimos que soporte resuelva problemas y no solo cierre tickets dentro del SLA?
No son problemas equivalentes.
La analogía se rompe si intentamos convertirla en teoría total.
Lo que comparten es algo más humilde.
Tenemos objetivos ricos.
Para coordinar sistemas los reducimos a señales operables.
La reducción pierde información.
Después optimizamos.
Y a veces olvidamos lo que habíamos perdido.
El proxy no es el enemigo
Después de leer sobre Goodhart aparece una reacción tentadora.
Las métricas son malas.
Los dashboards deshumanizan.
Volvamos al criterio, a la intuición, al sentido común.
No me convence.
El sentido común también es una representación imperfecta. Solo que peor documentada.
Necesitamos proxies.
No podemos observar directamente calidad, aprendizaje, satisfacción o riesgo en toda su complejidad cada vez que hay que decidir.
El problema no es simplificar.
Es olvidar que estamos simplificando.
Tampoco creo que la solución sea poner cincuenta indicadores.
Puede ayudar medir varias dimensiones. Puede hacer visibles compensaciones. Puede dificultar optimizar una única cifra absurda.
Pero cincuenta variables siguen siendo un modelo.
Podemos construir un dashboard extraordinariamente sofisticado y haber olvidado exactamente aquello que importaba.
No existe una cantidad de KPIs a partir de la cual el mapa se convierte en territorio.
He acabado con cinco movimientos
Cuando intento reducir el problema, veo algo parecido a cinco movimientos.
Tenemos un objetivo difícil de observar.
Construimos un proxy.
Vinculamos consecuencias al proxy.
El sistema se adapta.
Proxy y objetivo pueden empezar a divergir.
No es una ley universal.
Es mi forma de mirar el problema.
Y falta una flecha.
Cuando aparece divergencia, deberíamos volver al principio.
Revisar el objetivo.
Revisar la métrica.
Revisar qué ha cambiado.
Eso convierte el modelo en un bucle:
objetivo → proxy → incentivo → adaptación → divergencia → revisión
Me gusta más así.
Porque una métrica no debería ser una verdad permanente.
Debería ser una hipótesis operativa.
Mientras siga ayudándonos a ver.
Medir también es gobernar
Una categoría es un modelo.
Una base de datos es un modelo.
Un KPI es un modelo.
Una función de recompensa es un modelo.
Todos deciden qué conservar, qué ignorar, qué separar y qué relacionar.
Y después utilizamos esas representaciones para tomar decisiones.
Algo recibe presupuesto.
Algo deja de recibirlo.
Alguien cobra un bonus.
Un equipo cambia prioridades.
Un algoritmo elige una acción.
Entonces la representación deja de ser solamente descriptiva.
Empieza a gobernar.
No porque los números sean políticos por naturaleza.
Porque decidir qué cuenta distribuye atención y consecuencias.
Eso me parece una responsabilidad bastante mayor que «hacer un dashboard».
Estamos eligiendo qué versión del sistema será visible.
El sistema no falló
Empecé con una frase contundente:
El sistema no falló. Hizo exactamente lo que le pedimos.
Después de darle vueltas, tampoco creo que sea completamente cierta.
Los sistemas humanos no obedecen como una función matemática.
Las personas interpretan.
Tienen intereses propios.
Las métricas contienen ruido.
Las relaciones causales cambian.
Los algoritmos pueden encontrar estrategias inesperadas.
Hay demasiadas cosas ocurriendo como para afirmar que todo resultado perverso era literalmente aquello que habíamos pedido.
Pero sigo queriendo conservar la frase.
Porque obliga a mirar una parte que solemos saltarnos.
Antes de acusar al sistema, podemos preguntar:
¿qué hicimos visible, premiable y optimizable?
Queríamos ventas y premiamos llamadas.
Queríamos aprendizaje y premiamos notas.
Queríamos calidad y premiamos velocidad.
Queríamos engagement y premiamos clics.
Queríamos que una IA resolviera una tarea y construimos una señal que parecía representar correctamente la tarea.
Después el sistema empezó a organizarse alrededor de aquello que podía ver.
No porque las métricas sean inútiles.
No necesariamente porque el diseño fuera estúpido.
Sino porque especificar perfectamente lo que queremos puede ser mucho más difícil que reconocerlo cuando lo vemos.
Y entonces la pregunta deja de ser:
¿cuál es el KPI correcto?
Empieza a ser:
¿qué parte de la realidad estamos convirtiendo en objetivo cuando elegimos este KPI y qué puede ocurrir cuando el sistema aprenda a optimizarlo de verdad?
Porque una métrica no permanece dentro de un dashboard.
Cuando produce consecuencias, entra en el mundo.
Las personas la aprenden.
Las organizaciones se adaptan.
Los algoritmos la maximizan.
El mapa empieza a modificar el territorio.
Y entonces quizá ya no baste con preguntar si estamos midiendo bien.
Tenemos que comprobar algo más incómodo:
¿seguimos mejorando la realidad o ya estamos mejorando solamente la representación que construimos de ella?
El problema es que, desde dentro del dashboard, ambas cosas pueden parecer exactamente iguales.
Todo está verde.
Referencias
Strathern, M. (1997). ‘Improving ratings’: audit in the British University system. European Review, 5(3), 305–321.
Campbell, D. T. (1979). Assessing the impact of planned social change. Evaluation and Program Planning, 2(1), 67–90. DOI: 10.1016/0149-7189(79)90048-X.
Jacob, B. A. y Levitt, S. D. (2003). Rotten Apples: An Investigation of the Prevalence and Predictors of Teacher Cheating. The Quarterly Journal of Economics, 118(3), 843–877.
Bevan, G. y Hood, C. (2006). What’s Measured Is What Matters: Targets and Gaming in the English Public Health Care System. Public Administration, 84(3), 517–538. DOI: 10.1111/j.1467-9299.2006.00600.x.
Manheim, D. y Garrabrant, S. (2018). Categorizing Variants of Goodhart’s Law. arXiv:1803.04585.
Amodei, D. et al. (2016). Concrete Problems in AI Safety. arXiv:1606.06565.
Pan, A., Jones, E., Jagadeesan, M. y Steinhardt, J. (2024). Feedback Loops With Language Models Drive In-Context Reward Hacking. Proceedings of ICML 2024, PMLR 235, 39154–39200.
Deja una respuesta