Backtesting de una inspección: demostrar que funciona antes de implementarla

Fleet yield dashboard showing overall yield and a per-camera breakdown with one station running noticeably lower than the rest

La forma habitual de averiguar si una inspección funciona es instalarla y observar. Es un experimento costoso, porque lo que se está evaluando es que un defecto llegue a un cliente, y solo se conoce la respuesta después de que eso ocurra.

El backtesting es la alternativa. Se reúnen imágenes cuya condición real ya se conoce, se ejecuta la receta completa sobre cada una de ellas fuera de línea, y se obtienen las cifras de escape y sobrerrechazo antes de que la estación controle una sola pieza real. No es una idea novedosa. Es lo que atraviesa cualquier otro calibre de la planta antes de que se confíe en él, y no hay razón para que una inspección de IA esté exenta.

Qué hace realmente un backtest

El mecanismo es lo bastante simple como para describirlo en una frase: se toma un conjunto de capturas, se etiqueta qué es realmente cada una, se ejecuta la receta en vivo sobre todas ellas y se compara el veredicto de la receta con la etiqueta.

Dos detalles marcan la diferencia entre una prueba real y una demostración. El primero es que se ejecuta la whole receta, todos los modelos y todas las reglas, no un solo modelo de forma aislada. Una estación suele fallar en las uniones: dos modelos que funcionan correctamente por separado y una regla de veredicto que los combina de forma incorrecta. Probar los modelos por separado nunca detecta eso.

El segundo es que el resultado es una matriz de confusión en la que se puede entrar haciendo clic. Un número que indica que hubo cuatro escapes es un buen comienzo. Poder abrir esas cuatro imágenes y ver qué tenían en común es lo que permite corregir la causa en lugar de ajustar un umbral hasta que el número mejore.

Construir un conjunto de prueba que no le favorezca artificialmente

Aquí es donde la mayoría de las validaciones fallan, y fallan en una dirección predecible. Si se les deja actuar libremente, las personas reúnen aprobaciones evidentes y fallos evidentes, porque son las piezas que se pueden etiquetar con confianza fácilmente. Los números resultantes se ven excelentes y no sobreviven al contacto con la producción.

Incluya los casos discutidos

Las piezas sobre las que sus propios inspectores no se ponen de acuerdo son las imágenes más valiosas que tiene. Ahí es donde se sitúa el límite de decisión real. Un conjunto de prueba sin ellas solo mide la pregunta fácil.

Abarque la variación real

Distintos lotes de material, distintos turnos, el utillaje al final de su vida útil además del nuevo. Si el conjunto proviene de una sola tarde, describe esa única tarde.

Etiquete por consenso, no por una sola persona

La verdad de referencia es una decisión, no una observación. Si dos ingenieros etiquetan las piezas límite de forma diferente, ese desacuerdo es un problema de especificación, y es mejor detectarlo ahora que después de la puesta en marcha.

Consérvelo y vuelva a ejecutarlo

Un conjunto de prueba usado una sola vez es una demostración. Vuelva a ejecutarlo después de cada cambio de receta, o estará ajustando un número mientras rompe silenciosamente otro. Los conjuntos de prueba que se transfieren entre cámaras como un archivo hacen que esto sea práctico en toda una flota.

Una comprobación útil para cualquier conjunto de prueba: si la receta obtiene una puntuación perfecta en la primera ejecución, es probable que el conjunto sea demasiado fácil y no que la receta sea perfecta. Las piezas realmente límite generan algunos desacuerdos, y esos son los interesantes.

Repetibilidad, y por qué los equipos de calidad la exigen

La exactitud en una sola pasada no es lo mismo que la fiabilidad. Una estación puede acertar en promedio y aun así ser inutilizable si da respuestas diferentes a la misma pieza en distintas ejecuciones, porque la disposición final depende de la respuesta que se haya obtenido en ese momento.

Esto es lo que mide un estudio de repetibilidad y reproducibilidad del calibre, algo que ya es rutinario para un calibre pie de rey, un calibre de interiores o una máquina de medición por coordenadas. Ejecutarlo en una inspección de visión significa pasar las mismas piezas más de una vez y comparar los veredictos. Cuando los resultados divergen, se han encontrado piezas límite genuinas situadas exactamente en el límite de decisión, o bien una fuente de variación en la propia estación: una iluminación que no es tan estable como todos suponían, una pieza que se asienta de forma distinta, una exposición que varía con el tiempo.

También es una pregunta razonable para hacerle a un proveedor. Pedir un R&R del calibre en un sistema de visión le dice rápidamente si han implementado el sistema en una fabricación regulada o si simplemente le van a enviar un único porcentaje de exactitud con la esperanza de que baste.

El rendimiento por estación separa dos problemas muy diferentes

Una vez que una estación está en funcionamiento, la vista más útil no es la tasa de aprobación global. Es la tasa de aprobación desglosada por cámara, línea o máquina, porque la forma de ese desglose indica qué tipo de problema se tiene.

Yield breakdown by camera showing five stations between 98.8 and 100 percent and one at 92.4 percent
Mismo producto, misma aplicación, una sola línea. Cinco puntos de vista se sitúan entre 98.8% y 100%, y uno se sitúa en 92.4%. Esa brecha es el hallazgo, no el titular de 94.46% que aparece por encima.

Una estación atípica como esa casi nunca es un problema del modelo, porque todas las estaciones ejecutan el mismo modelo. Es una diferencia física: un utillaje con más holgura, una luz que se ha desviado o ha sido golpeada, un punto de vista donde la pieza se presenta de forma distinta, o una diferencia de proceso real en esa posición. El número agregado lo habría ocultado por completo, y promediar en toda una flota es precisamente cómo una sola estación defectuosa permanece invisible durante meses.

El caso inverso también merece mencionarse. Si todas las estaciones caen a la vez, no es un problema de utillaje, es el proceso o el modelo. Mismos datos, dos investigaciones muy diferentes, y el desglose es lo que le indica en cuál de ellas se encuentra.

Una secuencia de validación que se puede incluir en una especificación

  1. Acuerden el conjunto de defectos. Ambas partes aprueban formalmente qué piezas son defectuosas, incluidas las límite. Este es el paso que evita la discusión posterior.
  2. Construyan el conjunto de prueba a partir de producción real, abarcando lotes y turnos, con la verdad de referencia etiquetada por consenso.
  3. Ejecuten la receta completa fuera de línea y registren los escapes y sobrerrechazos como cifras absolutas, no como un porcentaje de exactitud.
  4. Abran los fallos. Cada escape y cada sobrerrechazo se revisa. Los patrones que aparecen en ellos son el verdadero resultado del ejercicio.
  5. Ejecútenlo dos veces y comparen los resultados, para que la repetibilidad sea un número medido y no una suposición.
  6. Definan la sensibilidad según el costo, utilizando las cifras de escape y sobrerrechazo frente a lo que cada uno les cuesta. Esta es una decisión de negocio, no una preferencia técnica.
  7. Conserven el conjunto de prueba junto con la receta y vuelvan a ejecutarlo como un paso de aceptación después de cualquier cambio, incluido un reentrenamiento.

Hay dos aspectos de esa lista que merece la pena destacar. No contiene ninguna cifra de exactitud en ningún punto, de forma deliberada, por las razones expuestas en nuestro artículo sobre escape frente a sobrerrechazo. Y el paso siete es el que se degrada primero: un conjunto de prueba que no se vuelve a ejecutar después de un reentrenamiento es la razón por la que una estación que aprobó la validación en marzo deja de funcionar silenciosamente en junio.

Nada de esto es específico de la IA, y esa es precisamente la cuestión. Es la misma disciplina que un equipo de calidad ya aplica a cualquier otro dispositivo de medición, aplicada a uno más nuevo. Cómo encaja esto en el diseño más amplio de una estación se aborda en nuestra guía sobre sistemas de visión artificial, y si está validando una estación de detección de anomalías en particular, las piezas límite importan aún más de lo habitual, porque el punto de disparo es un único ajuste de sensibilidad en lugar de un límite aprendido.

Frequently Asked Questions

¿Qué es el backtesting en visión artificial?

El backtesting ejecuta una receta de inspección completa fuera de línea sobre un conjunto de imágenes cuya condición real ya se conoce, y compara el veredicto de la receta con esa verdad de referencia. Produce cifras de escape y sobrerrechazo antes de que la estación controle cualquier producción real, lo que sustituye a la costosa alternativa de descubrir el rendimiento en producción, donde el fallo evaluado es que un defecto llegue a un cliente. Es fundamental que ejecute la receta completa, todos los modelos y todas las reglas, porque las estaciones suelen fallar en las uniones entre modelos que se comportan correctamente.

¿Cómo se construye un buen conjunto de prueba para una inspección de visión?

Incluya las piezas límite sobre las que sus propios inspectores discrepan, porque ahí es donde se sitúa el límite de decisión real. Abarque la variación real: distintos lotes de material, distintos turnos, utillaje desgastado además de nuevo. Etiquete la verdad de referencia por consenso entre más de una persona, ya que el desacuerdo sobre piezas límite es un problema de especificación que conviene detectar cuanto antes. Después conserve el conjunto y vuelva a ejecutarlo después de cada cambio de receta. Si una receta obtiene una puntuación perfecta en la primera ejecución, es probable que el conjunto sea demasiado fácil y no que la receta sea perfecta.

¿Se puede ejecutar un estudio R&R del calibre en un sistema de visión con IA?

Sí, y es razonable exigirlo. En la práctica significa pasar las mismas piezas más de una vez y comparar los veredictos. La divergencia apunta a piezas realmente límite situadas en el límite de decisión, o a una fuente de variación en la propia estación, como una iluminación que no es tan estable como se supone, un asentamiento inconsistente de la pieza o una exposición que varía con el tiempo. La repetibilidad del calibre ya es rutinaria para calibres pie de rey y máquinas de medición por coordenadas, y una inspección automatizada no debería ser una excepción.

¿Por qué observar el rendimiento por estación en lugar del rendimiento global?

Porque la forma de ese desglose indica qué tipo de problema se tiene. Si una estación se sitúa muy por debajo de las demás mientras ejecuta el mismo modelo, casi con toda seguridad es algo físico: holgura del utillaje, una luz que se ha desviado, un punto de vista donde la pieza se presenta de forma distinta. Si todas las estaciones caen a la vez, entonces es el proceso o el modelo. Dos investigaciones completamente diferentes, y una cifra agregada oculta esa distinción, que es precisamente cómo una sola estación defectuosa permanece invisible durante meses.

¿Con qué frecuencia se debe volver a ejecutar un conjunto de prueba?

Después de cada cambio en la receta, incluido un reentrenamiento. Este es, en la práctica, el paso que se degrada primero, y omitirlo es la razón por la que una estación que aprobó la validación en un mes deja de funcionar silenciosamente unos meses después. Tratar la nueva ejecución como una puerta de aceptación, con la versión del conjunto de prueba controlada junto con la receta, es lo que mantiene la validación con sentido en lugar de ser un ejercicio puntual durante la puesta en marcha.

¿Debe una especificación de validación incluir un objetivo de exactitud?

No. La exactitud depende en gran medida de cuántas piezas buenas y malas haya en el conjunto, por lo que puede verse excelente sin detectar nada, y promedia dos errores con costos muy diferentes. Especifique el número de escapes sobre un conjunto de defectos acordado, el sobrerrechazo como porcentaje de la producción, la repetibilidad demostrada en al menos dos ejecuciones, y un conjunto de prueba conservado que se vuelva a ejecutar después de cualquier cambio. Esos cuatro elementos son medibles, significativos y difíciles de manipular.

Vea Overview AI en sus piezas

Envíenos una foto de su pieza o defecto y un ingeniero de visión le dirá si Overview puede detectarlo, con la mayoría de los sistemas funcionando en la línea en días.

Artículos relacionados