Convertir objetivos en criterios
«El reporte quedó bueno» no permite comparar versiones. Define qué debe contener: todos los IDs, fechas exactas, fuentes, pendientes y acciones dentro de permiso. Separa errores críticos de defectos de presentación. Un diseño atractivo no compensa una orden inventada.
Las evaluaciones utilizan casos y criterios para comprobar comportamiento. Este curso propone una pauta de negocio; no obliga a una herramienta concreta. Se pueden revisar salidas manualmente, combinar controles automáticos y utilizar evaluadores adicionales cuando corresponda.
Una muestra representativa
Incluye casos normales, incompletos, contradictorios, duplicados y fallos de herramienta. Conserva una parte de los casos para comprobar versiones nuevas sin ajustar el prompt a todos ellos. Define la respuesta esperada con una persona que conoce el proceso.
Una muestra inicial ayuda a encontrar defectos; no demuestra fiabilidad universal. Registra tamaño, selección y límites. Si la categoría más difícil contiene sólo un caso, evita generalizar desde ese resultado.
Medidas complementarias
La exactitud de fechas puede contarse como campos correctos sobre campos revisados. La cobertura es IDs tratados sobre IDs de entrada. El tiempo total incluye preparación, ejecución, revisión y corrección. Registra también costo del servicio, mantenimiento y esfuerzo de operación cuando estén disponibles.
Ejemplo ficticio: 18 de 20 fechas correctas equivale a 90% en esa muestra. Si los dos errores generan compromisos falsos, el promedio no basta para aprobar. La categoría de error importa tanto como la tasa. Para un piloto, puedes exigir cero errores críticos en la muestra, aclarando que eso no garantiza cero fallos futuros.
De productividad a valor de negocio
Cuatro horas semanales liberadas representan capacidad. Para demostrar valor económico, observa qué uso recibieron: atender más clientes, reducir horas contratadas o mejorar cumplimiento. No multipliques automáticamente por ventas esperadas ni atribuyas todo cambio del negocio a la IA.
Compara períodos y tareas similares, documenta otros cambios y revisa efectos no deseados. Si es posible, usa un grupo o proceso de comparación. La evidencia debe sostener el alcance de la conclusión.
Una decisión explícita
Antes del piloto fija condiciones para continuar, ajustar o detener. Publica el resultado con denominadores, fallos y limitaciones. Repite pruebas relevantes después de cambiar instrucciones, modelo, fuentes o permisos. La evaluación sostiene el sistema durante su uso; no termina cuando se aprueba una primera versión.