Respuesta breve
Whoever supplies the examples decides the outcome of an AI evaluation. If the vendor brings the demo data, the procurement has already been settled before the first meeting.
La idea central
Quien suministra los ejemplos decide el resultado de la evaluación de IA. Si el proveedor trae los datos de la demo, la compra ya está decidida antes de la primera reunión.
Los procesos de selección de IA suelen ser una secuencia de demostraciones: cada proveedor presenta lo mejor y el equipo comprador compara impresiones de sistemas mostrados bajo materiales que el proveedor escoge. Todos saben que esto es débil y el remedio habitual es un piloto pagado — costoso, lento, e informalmente calificado por quienes vieron las demos.
Qué cambió y por qué importa ahora
El indicio está en cómo se reduce una lista corta. Equipos que sólo vieron demos llegan a preferencias difíciles de explicar, con razones cambiantes: se sintió más pulido, equipo más fuerte, hoja de ruta clara. Quienes aportan sus propios ejemplos describen su elección en números y debaten pesos, no impresiones. El segundo tipo de discrepancia es productivo; el primero lleva a contratos de tres años que no se pueden justificar después de 18 meses.
Construya el modelo operativo
Reúna un conjunto retenido de sus propios casos con resultados correctos antes de contactar cualquier proveedor, y califique cada demo bajo las mismas condiciones usando ese conjunto.
Doscientos ejemplos suelen bastar y son posibles en dos semanas. Muestree según la distribución real, no la descrita: incluya mayoría rutinaria, casos de temporada, entradas mal formadas y aquellos que sus expertos no se ponen de acuerdo. Este último grupo es valioso pero omitido, porque refleja ambigüedad interna. Defina respuestas correctas dentro de la organización y registre desacuerdos — un caso sin consenso no se cuenta contra un proveedor, pero muestra dónde el proceso es ambiguo.
Mida lo que produjo la decisión
Califique precisión sobre el conjunto retenido, perfil de errores por categoría, costo por mil casos a su volumen, y latencia en pico en lugar de promedio.
El perfil de errores importa más que la precisión total, porque errores no son iguales. Un sistema al 92% fallando aleatoriamente suele superar uno al 94% fallando sistemáticamente en una categoría que representa una quinta parte de ingresos. Reporte rendimiento por categoría y rechace un número único agregado. En costo, modele su distribución real, incluyendo reintentos e entradas largas, porque tarifas unitarias basadas en promedio subestiman el costo a volumen.
Dónde falla la ejecución
El mayor riesgo es construir el conjunto sólo con registros limpios históricos, creando un benchmark que no refleja los inputs reales y desordenados que recibirá el sistema.
Otro riesgo es filtrar el conjunto. Cuando se comparte con un proveedor para piloto, deja de ser una medida retenida para rondas posteriores y evaluaciones de renovación que en realidad miden memorización. Mantenga un subconjunto reservado nunca compartido, úselo sólo en renovación y mantenga confidencial su existencia. Esto es higiene administrativa básica, y marca la diferencia entre decisiones de renovación con evidencia y basadas en familiaridad con el proveedor vigente.
Cómo se ve esto en la práctica
En la práctica, el ejercicio toma a un analista dos semanas y cambia completamente la contratación. A los proveedores se les envían los mismos cien casos, devuelven resultados en un formato fijo y son evaluados por alguien que no asistió a las demostraciones. Los cien restantes quedan en reserva. Las conversaciones que siguen son notablemente diferentes: los proveedores preguntan sobre las categorías de error en lugar de la línea de tiempo, y los que se comprometen seriamente con una categoría en la que obtuvieron una puntuación baja suelen ser los que valen la pena preseleccionar. También cambia la conversación interna. Un comité de contratación que ha discutido durante semanas sobre qué sistema parece más capaz puede resolver la discusión en una tarde una vez que los mismos cien casos se han ejecutado a través de cada uno, y el desacuerdo residual es sobre cuánto importa una categoría de error particular para el negocio, lo cual es una decisión que el comité está realmente calificado para tomar y en la que debería haber estado dedicando su tiempo. Una precaución práctica: fije el formato de salida antes de enviar cualquier cosa. A los proveedores que se les pida respuestas en formato libre devolverán cada uno una estructura diferente, y la evaluación entonces se convierte en un ejercicio de interpretación que reintroduce exactamente la subjetividad que el conjunto fue construido para eliminar. Un esquema corto y un ejemplo trabajado son suficientes, y lleva una hora.
El argumento más fuerte en contra de esto
La objeción justa es que un conjunto reservado premia la capacidad que ya puedes medir y penaliza aquella que no puedes. Los sistemas difieren de maneras que una puntuación de precisión no captura: cómo fallan, cómo se explican a sí mismos, cómo se comportan con entradas diferentes a todo lo que tienes en tu historial; y un proceso puramente cuantitativo puede seleccionar un producto optimizado para el punto de referencia en vez de uno genuinamente mejor.
Así que el conjunto debería decidir la lista corta, no el ganador. Úsalo para eliminar sistemas que no pueden hacer el trabajo, luego elige entre los sobrevivientes según criterios cualitativos que las puntuaciones no pueden alcanzar: modelo de soporte, términos de datos, costo de salida y si el equipo responde preguntas difíciles con franqueza. Lo que el conjunto elimina es la posibilidad de elegir solo por impresiones, lo cual es una afirmación más modesta de lo que parece y una mejora mucho mayor de lo que parece.
Una secuencia de implementación de 30 días
Muestree doscientas casos reales con resultados conocidos en esta quincena, divídalos por la mitad y envíe los primeros cien a cada proveedor en la lista.
Días uno a tres, defina las categorías y el marco muestral. Días cuatro a ocho, extraiga los casos y haga que dos personas experimentadas los etiqueten de forma independiente; la tasa de desacuerdo es su límite máximo para cualquier proveedor. Días nueve a diez, resuelva o excluya los desacuerdos y congele el conjunto. Día once, divida y bloquee la mitad de reserva en un lugar al que el equipo de adquisiciones no pueda acceder casualmente. Día doce en adelante, haga que cada proveedor evalúe los mismos cien casos en el mismo formato, puntuados a ciegas.
Mantenga la reserva mitad genuinamente reservada
Registre quién tiene acceso a la partición de reserva y cuándo fue utilizada por última vez. La falla rara vez es deliberada: alguien necesita una verificación rápida de cordura antes de una renovación, toma el conjunto disponible más cercano, y la reserva se gasta sin que nadie decida gastarla. Trátela como un activo controlado con un propietario nombrado y un registro, y renueve quizás una quinta parte anualmente para que refleje la deriva en lo que realmente recibe. Un conjunto ensamblado hace tres años y nunca renovado está midiendo una carga de trabajo que ya no existe.
Reevalúe al titular contra la mitad de reserva en cada renovación y contra una muestra fresca anualmente. Lea ambos juntos: un rendimiento fuerte en el conjunto original con un rendimiento más débil en la muestra fresca es la señal de deriva, ya sea en el sistema del proveedor o en sus propios datos, y la distinción vale la pena establecerla antes de la discusión del contrato en lugar de durante ella.
Conclusión editorial
Los procesos de compra de IA son complejos en todo salvo en lo que determina calidad. Dos semanas de un analista antes del primer contacto convierten decisiones por impresiones en decisiones basadas en evidencia — y proveen un instrumento útil para renovación, que nadie espera y todos terminan necesitando.
Lista práctica
- Primer paso: Muestree doscientas muestras reales con resultados conocidos esta quincena, divídalas en dos y entregue las primeras cien a cada proveedor de la lista.
- Qué medir: Califique precisión sobre el conjunto retenido, perfil de errores por categoría, costo por mil casos a su volumen y latencia en su pico en vez de promedio.
- Riesgo a vigilar: Construir el conjunto sólo con registros históricos limpios genera un benchmark que no refleja los desordenados inputs reales.
- Asignar un responsable visible y una fecha de revisión.
- Separar evidencia de interpretación.
- Capturar una línea base antes de modificar el proceso.
Preguntas frecuentes
¿Cómo evaluar objetivamente a proveedores de IA?
Construya un conjunto retenido con sus propios casos y resultados conocidos antes de contactar a proveedores, envíe a todos el mismo subconjunto en igual formato, y que un evaluador ajeno a las demos califique los resultados.
¿Cuántos ejemplos necesita un conjunto de evaluación para IA?
Unos doscientos suelen ser suficientes y toman aproximadamente dos semanas a un analista. Muestree a lo largo de la distribución real, incluyendo entradas mal formadas y casos con opiniones divididas entre sus expertos.
¿Por qué reservar la mitad del conjunto de evaluación?
Una vez compartidos los ejemplos con un proveedor, dejan de ser una medida retenida, y una renovación basada en ellos mide memorización. Mantener un subconjunto reservado nunca compartido permite decisiones de renovación basadas en evidencia.
¿Es la precisión el indicador correcto para un proveedor de IA?
No solo la precisión. El perfil de errores importa más, porque los errores no son intercambiables: un sistema al 92% con fallos aleatorios suele ser mejor que uno al 94% que falla sistemáticamente en categoría clave que representa un 20% de ingresos.
¿Debe el conjunto de evaluación decidir el ganador?
Debe decidir la preselección. Use para eliminar sistemas que no pueden hacer el trabajo, luego elija entre los sobrevivientes según modelo de soporte, condiciones de datos, costo de salida y transparencia en respuestas difíciles.
