¿Hasta cuándo nos engañaremos con los benchmarks de IA?
Inteligencia Artificial · Actualidad
¿Hasta cuándo nos engañaremos con los benchmarks de IA?
Publicado el 6 de octubre de 2026 · Tech & IA Future · 9 min de lectura
Este miércoles 7 de octubre, el investigador Ricardo Baeza-Yates (KTH Royal Institute of Technology de Estocolmo y Universitat Pompeu Fabra de Barcelona) imparte en la Universidad de Castilla-La Mancha una conferencia con un título que debería incomodar a todo el sector: «Evaluación de modelos de aprendizaje automático: ¿hasta cuándo nos engañaremos a nosotros mismos?».
No hace falta asistir a la charla para entender por qué importa. Cada semana aparece un modelo nuevo presumiendo de superar a otro en algún benchmark: MMLU, GSM8K, HumanEval, GPQA... Números que se repiten en titulares, comparativas y vídeos de YouTube como si fueran un hecho objetivo. El problema es que buena parte de esos números están dejando de significar lo que parecen significar.
Qué es un benchmark (y por qué nos fiamos tanto de ellos)
Un benchmark de IA es, en esencia, un examen estandarizado: un conjunto de preguntas o tareas fijas que se usa para comparar modelos en igualdad de condiciones. MMLU mide cultura general en decenas de materias; GSM8K, problemas matemáticos de nivel escolar; HumanEval, si el código generado pasa realmente sus pruebas.
La promesa es sencilla: si el modelo A saca más puntos que el modelo B en el mismo examen, A es mejor. Esa promesa lleva años sosteniendo gran parte del marketing de la industria de la IA. El problema es que, como en cualquier examen que se repite demasiado, acaba filtrándose.
El problema de fondo: contaminación y saturación
Hay dos fenómenos que están erosionando la fiabilidad de estas pruebas, y conviene distinguirlos:
Contaminación de datos. Los benchmarks son públicos: están colgados en internet para que cualquiera los use. Pero los modelos se entrenan rastreando internet. El resultado es que las preguntas del examen (o variantes muy parecidas) acaban dentro de los datos de entrenamiento. El modelo no razona la respuesta: la recuerda. Investigaciones recientes han documentado niveles de contaminación que en algunos benchmarks muy usados llegan a ser prácticamente totales.
Saturación del benchmark. Cuando casi todos los modelos top rondan el máximo posible, el examen deja de distinguir nada: la diferencia entre el primero y el décimo se vuelve ruido estadístico. Un estudio presentado en ICML 2026 analizó 60 benchmarks de lenguaje habituales y encontró señales de saturación en cerca de la mitad.
La ley de Goodhart, aplicada a la IA
Hay un principio económico que resume el problema mejor que cualquier informe técnico: «cuando una medida se convierte en objetivo, deja de ser una buena medida». Si una empresa sabe que los periodistas van a citar su puntuación en un benchmark concreto, tiene un incentivo enorme para optimizar justo ese examen, aunque eso no mejore la capacidad real del modelo en el uso diario.
No hace falta imaginar mala fe generalizada. Basta con que el equipo que entrena el modelo vea ese número en su panel de control cada semana. Lo que se mide, se gestiona; y lo que se gestiona, tiende a mejorar en el papel antes que en la práctica.
No es solo un problema de laboratorio
Esto deja de ser un debate académico en cuanto decides qué herramienta de IA usar para tu trabajo, tu empresa o tu blog. Algunos datos que conviene tener en cuenta:
- Estudios de 2026 documentan una diferencia media de en torno al 37% entre la puntuación de laboratorio de un modelo y su rendimiento real en producción.
- Algunos datasets ampliamente usados, como la parte de matemáticas de MMLU, tienen tasas de error documentadas en sus propias preguntas de hasta el 42%: el propio examen está mal hecho.
- Un modelo puede destacar en razonamiento académico y fallar con facturas, historiales clínicos, contratos o la jerga concreta de tu sector, porque ese tipo de contenido no se parece al de los benchmarks públicos.
Qué se está intentando arreglar
El propio Baeza-Yates lleva años trabajando en IA responsable, y el campo no se ha quedado de brazos cruzados. Algunas líneas de trabajo actuales:
- Benchmarks dinámicos: conjuntos de preguntas que se renuevan con frecuencia, para que no dé tiempo a que se filtren en el siguiente entrenamiento.
- Pruebas más resistentes a la memorización: evaluaciones como GPQA Diamond o LiveCodeBench, diseñadas para premiar el razonamiento sobre la respuesta aprendida.
- Intervalos de confianza: exigir que cualquier puntuación venga acompañada de su margen de error, en lugar de presentar un número suelto como si fuera definitivo.
- Evaluación de agentes, no solo de modelos: a medida que la IA deja de ser un modelo estático y pasa a actuar con herramientas (buscar, ejecutar código, usar apps), medir solo la respuesta final se queda corto; hay que evaluar también el proceso.
Cómo leer un benchmark sin que te la cuelen
No necesitas ser investigador para aplicar un poco de escepticismo sano. Antes de decidirte por una IA porque «gana en tal benchmark», pregúntate:
- ¿Viene con margen de error? Un número sin intervalo de confianza no te dice si la diferencia con el segundo clasificado es real o ruido.
- ¿Es un benchmark saturado? Si la mayoría de los modelos top rondan el máximo, la posición exacta en la tabla importa poco.
- ¿Se parece el benchmark a tu caso de uso real? Un examen de matemáticas de instituto no predice cómo responderá el modelo ante el contrato de tu proveedor.
- ¿Hay alguna prueba propia, aunque sea pequeña? Diez ejemplos reales de tu trabajo valen más que un ranking genérico.
Una pequeña prueba que puedes hacer hoy
Si usas IA para trabajar o estudiar, monta tu propio «mini-benchmark» en diez minutos:
- Reúne cinco tareas reales que repitas a menudo (resumir un tipo de documento, escribir cierto tipo de correo, depurar cierto tipo de código).
- Pide la misma tarea a dos herramientas distintas, con el mismo texto de entrada.
- Compara no solo si «suena bien», sino si acierta los datos, respeta el formato que pediste y no se inventa nada.
- Repite la prueba cada pocos meses: los modelos cambian de versión con frecuencia.
Esa comparación, modesta y nada científica, te dirá más sobre qué herramienta te conviene que cualquier tabla con un 95% en un examen que no vas a hacer tú.
Mi opinión
Llevo meses escribiendo en este blog sobre herramientas de IA, y reconozco que yo también he citado benchmarks sin pararme a pensar si ese número decía algo real. Esta charla me parece un buen recordatorio de algo que se nos olvida fácilmente: la IA avanza rapidísimo, pero nuestra forma de medirla no avanza al mismo ritmo, y eso deja un hueco donde el marketing ocupa el lugar de la evidencia. Mi conclusión práctica es sencilla: sigo mirando los benchmarks como una primera referencia, nunca como la última palabra, y antes de recomendar una herramienta en este blog intento probarla yo mismo con una tarea real. No es infalible, pero es mucho más honesto que repetir un porcentaje que ni siquiera sé cómo se ha calculado.
Preguntas frecuentes
¿Qué significa que un benchmark esté «contaminado»?
Que las preguntas de ese examen, o variantes muy parecidas, aparecían ya en los datos con los que se entrenó el modelo. El modelo no razona la respuesta, la recuerda, y la puntuación deja de reflejar su capacidad real.
¿Qué significa que un benchmark esté «saturado»?
Que casi todos los modelos punteros sacan una puntuación muy cercana al máximo. Cuando eso pasa, el examen ya no sirve para distinguir cuál es mejor.
Entonces, ¿los benchmarks no sirven para nada?
Sí sirven, pero como una primera referencia, no como veredicto final. Son más fiables cuando vienen con margen de error, cuando no están saturados y cuando se complementan con pruebas propias sobre tu caso de uso real.
¿Cómo sé si un modelo me conviene para mi trabajo concreto?
Pruébalo tú mismo con tareas reales de tu día a día, no solo con lo que digan los rankings públicos. Una docena de ejemplos propios te da información más útil que una tabla genérica.
¿Dónde puedo seguir esta charla o saber más sobre el tema?
La conferencia de Ricardo Baeza-Yates se celebra el 7 de octubre en la Escuela Superior de Informática de la UCLM, dentro de su ciclo de conferencias de otoño. Si no puedes asistir, busca después sus publicaciones y entrevistas sobre evaluación de modelos de IA: es uno de los investigadores de referencia en IA responsable.
Fuentes: cobertura de prensa sobre el ciclo de conferencias de la Escuela Superior de Informática de la UCLM (octubre de 2026) y estudios recientes sobre contaminación y saturación de benchmarks de IA presentados en ICML 2026.
Comentarios
Publicar un comentario