Hay una pregunta que hacemos en todas las reuniones técnicas y que casi nunca tiene respuesta: “¿cómo sabréis si el cambio ha mejorado las cosas?”
Si la respuesta es “lo probamos y se nota”, el equipo está volando a ciegas.
El problema con los benchmarks públicos
El AI Index 2026 de Stanford documenta bien el fenómeno: SWE-bench Verified pasó del 60% a cerca del 100% en un año. Cuando un benchmark se satura, deja de discriminar — todos los modelos aprueban y la tabla ya no te ayuda a elegir.
Y luego está el problema más serio: el benchmark no mide tu tarea. El mismo informe recoge que los mejores modelos leen un reloj analógico bien el 50,1% de las veces. Un sistema puede ser excelente en razonamiento matemático y mediocre interpretando el formato concreto de factura de tu proveedor principal.
La investigación académica va en la misma dirección. El benchmark LaRA, con 2.326 casos de prueba sobre once modelos, concluye que la elección óptima entre recuperación y contexto largo depende de una interacción compleja entre capacidad del modelo, longitud del contexto, tipo de tarea y características de la recuperación. Traducción: no hay una respuesta general. Sólo hay respuestas para tu caso.
Qué es un set de evaluación propio
No es complicado, y ahí está la trampa: es tan poco sofisticado que los equipos lo saltan.
Es un fichero con casos reales de tu negocio y la respuesta correcta para cada uno. Entre 50 y 200 casos suele bastar para empezar. Para un clasificador de tickets: 150 tickets reales con su categoría correcta. Para extracción de facturas: 100 facturas con los campos que deberían salir.
La parte difícil no es técnica. Es conseguir que alguien que conoce el dominio se siente dos días a etiquetar casos. Ese es el precio de entrada, y es el mejor dinero que gastarás en todo el proyecto.
Por qué cambia todo
Convierte opiniones en números. “El nuevo prompt va mejor” pasa a ser “sube del 82% al 89% de precisión, y empeora en los casos con más de tres líneas”.
Hace posible cambiar de modelo. Con un eval propio, probar un proveedor nuevo es una tarde. Sin él, es una migración a ciegas que nadie quiere aprobar. Con seis modelos frontera a 25 puntos Elo unos de otros, esa agilidad vale dinero.
Detecta regresiones silenciosas. Los proveedores actualizan sus modelos. Tu sistema puede empeorar sin que nadie haya tocado una línea de código, y sin eval te enteras por una queja de cliente.
Protege del entusiasmo. Cuando alguien propone reescribir el sistema con la arquitectura de moda, el eval responde si merece la pena.
Cómo empezar esta semana
- Recoge 50 casos reales del proceso que quieres mejorar. Reales, con su ruido y sus rarezas.
- Escribe la respuesta correcta de cada uno. Que la escriba quien sabe del tema.
- Incluye los casos difíciles a propósito. El documento mal escaneado, la factura del proveedor raro, el cliente que escribe en tres idiomas.
- Ejecútalo en cada cambio. De prompt, de modelo, de herramienta, de versión.
- Guarda el histórico. La curva a lo largo del tiempo es lo que te dirá si el equipo avanza.
El modelo que uses hoy no será el de dentro de un año. Tu set de evaluación sí, y por eso es el único activo técnico del proyecto que se revaloriza.
Fuentes
- The 2026 AI Index Report — Stanford HAI
- LaRA: Benchmarking Retrieval-Augmented Generation and Long-Context LLMs — ICML
- EnterpriseRAG-Bench: A RAG Benchmark for Company-Internal Knowledge — arXiv
- A Systematic Literature Review of Retrieval-Augmented Generation: Techniques, Metrics, and Challenges — arXiv