Insights

Qué contiene realmente un scorecard de evaluación

“Parece que funciona” es la frase que precede a casi todos los proyectos de IA que se caen a los seis meses. Parece que funciona quiere decir que alguien probó diez preguntas, las diez salieron bien y nadie anotó cuáles fueron.

Un scorecard es lo que reemplaza esa frase. Es la boleta de calificaciones del sistema: un conjunto fijo de métricas, medidas sobre los mismos casos, en cada versión, y comparadas contra un punto de partida que se midió antes de construir.

Empieza antes del código: la línea base

La primera medición no es del sistema. Es del proceso como está hoy. Cuánto tarda un analista en conciliar una factura, cuántas veces tiene que volver a preguntar, cuántos casos se escalan, cuánto cuesta el ciclo completo.

Ese número es incómodo de levantar y es el único que convierte una discusión de opiniones en una de resultados. Sin línea base, la conversación de cierre del proyecto es sobre si el equipo lo siente más rápido. Con ella, es sobre cuántos minutos y cuántos pesos.

Las métricas que van en la boleta

  • Exactitud. Sobre un conjunto de casos reales de tu operación, con la respuesta correcta acordada de antemano, qué proporción resuelve bien.
  • Calidad de recuperación. Cuando el sistema busca en tus documentos, si trae los pasajes que efectivamente contienen la respuesta. Un sistema puede redactar bien sobre la fuente equivocada.
  • Respuestas inventadas (alucinaciones). Con qué frecuencia afirma algo que sus fuentes no sostienen. Se mide, no se promete que no ocurre.
  • Tiempo de respuesta (latencia). Cuánto espera el usuario. Un copiloto que tarda cuarenta segundos no se usa, aunque acierte.
  • Costo por operación. Lo que cuesta cada consulta o cada documento procesado, que es el número que decide si el caso escala a toda el área.

Las cinco se levantan sobre los mismos casos en cada versión. Eso es lo que permite hablar de regresión: si la versión nueva mejora exactitud pero duplica el costo, el scorecard lo muestra antes de que lo descubra la factura del mes.

Por qué corre en cada cambio

Un sistema de IA no es estable por defecto. Cambia el prompt, cambia la versión del modelo, cambia el conjunto de documentos indexados, y el comportamiento se mueve sin que nadie tocara el código. La suite de evaluación es el mecanismo que convierte ese movimiento en algo visible.

La regla operativa es simple: si una versión se degrada contra la anterior, no sale a producción. No es una política de calidad aspiracional, es una compuerta técnica que corre sola.

Qué ve la dirección

El scorecard es un instrumento de ingeniería. El comité no lo lee: lee el tablero de ROI, que muestra el impacto del sistema contra la línea base que se midió al principio, en las unidades del negocio. Horas del ciclo de cierre, tiempo de resolución, casos por persona.

Los dos objetos se sostienen mutuamente. El tablero sin scorecard es una afirmación; el scorecard sin tablero es una tabla que nadie fuera del equipo técnico sabe leer.

Si no se puede medir, no lo vendemos.

La suite de evaluación forma parte de todo lo que entregamos a producción; se arma con tus datos reales durante el Sprint de Construcción y se queda operando cuando el proyecto cierra.

Ver todos los artículos

Siguiente paso

Deja de evaluar IA en abstracto. Valida un flujo real.

En una llamada de 30 minutos identificamos dónde estás, qué bloquea la adopción y los tres casos de uso con mayor probabilidad de generar valor en tu organización.

Campo requerido
Correo de trabajo válido
Campo requerido
Campo requerido

Gracias. Te contactamos en menos de un día hábil para coordinar tu diagnóstico.

Sin compromiso · Agenda clara · Recomendaciones prácticas · Solicitar el manual