Inspeccionar con un iPhone

    Cómo etiquetar defectos para inspección visual con IA: guía de anotación con cajas delimitadoras

    Korbinian Kuusisto, CEO and founder of Enao Vision
    Korbinian KuusistoCEO & Founder, Enao Vision
    22 de septiembre de 2026
    Share:
    Cómo etiquetar defectos para inspección visual con IA: guía de anotación con cajas delimitadoras

    El primer modelo de detección de defectos que entrenamos fue malísimo, y fue culpa nuestra. Las fotos estaban bien y el modelo estaba bien. Las cajas que dibujamos alrededor de los defectos eran un desorden, y el modelo aprendió exactamente lo que le mostramos, que era confusión.

    Desde entonces etiquetamos muchísimas piezas, igual que la gente con la que trabajamos, y siempre vuelven a aparecer las mismas pocas cosas. Ninguna es complicada. La mayoría son obvias en cuanto alguien te las señala. Este artículo es ese alguien señalándolas.

    Resumen rápido

    Toma fotos desde distintos ángulos, distancias e iluminaciones para que el modelo aprenda el defecto y no el montaje. Después etiqueta cada defecto en cada imagen, dibuja cada caja ajustada, etiqueta siempre de la misma manera, deja que se superpongan las cajas de distintos tipos de defecto y empieza con clases detalladas que puedas fusionar más adelante. En la práctica, una caja honesta vale más que diez defectos pasados por alto, las muestras confusas no van en el dataset y, si dos personas la dibujarían distinto, la caja probablemente está mal.

    Tomar fotos: un principio

    Un modelo generaliza a partir de la variedad. Si todas las fotos de un poro se toman desde el mismo punto y bajo la misma lámpara, aprende ese punto y esa lámpara, y la primera vez que llega una pieza un poco girada se pone nervioso. Así que lo único que vale la pena hacer mientras reúnes imágenes de entrenamiento es moverte.

    Distintos ángulos. Rodea el defecto y fotografíalo desde varios lados. El mismo poro se ve diferente de frente y a 45 grados, y el modelo tiene que conocer ambas vistas.

    El mismo poro, dos ángulos: de lado y de frente.

    Distinta luz y fondo. Con mucha luz, con poca luz, en sombra, en el banco de trabajo, en la línea. Cambiar el fondo es la forma en que el modelo aprende a ignorarlo.

    El mismo poro, dos condiciones de luz: brillante y uniforme, luego tenue y con sombra.

    Distintas distancias. Acércate y aléjate. Un defecto que llena el encuadre y un defecto que es un puntito en una esquina son cosas que el modelo va a ver en producción.

    El mismo poro, dos distancias: de cerca y más lejos.

    Si tu cámara está fija en la línea, nada de esto es un problema. Una posición fija te da imágenes muy consistentes y un modelo muy bueno en esa única vista. La variedad importa sobre todo cuando usas el iPhone en la mano, o cuando un mismo modelo tiene que cubrir más de una estación.

    Etiquetado: cinco pilares

    Estas no son reglas de Enao. Aplican a cualquier anotación de imágenes para detección de objetos, y marcan la diferencia entre un modelo seguro de sí mismo y uno que te pide revisar todo dos veces.

    1. Etiqueta todos los defectos de la imagen

    Pilar 1: los tres defectos con su caja frente a uno que quedó sin etiquetar.

    Este fue el primero que hicimos mal. Si una imagen tiene tres defectos y le pones caja a dos, le acabas de decir al modelo que el tercero es fondo. Haz eso unas cuantas decenas de veces en un dataset y las alarmas reales y las falsas empiezan a confundirse, porque el mismo patrón se mostró como ambas cosas. Si lo ves, ponle una caja.

    2. Dibuja la caja ajustada al defecto

    Pilar 2: cajas delimitadoras recortada, ajustada y holgada, comparadas.

    Una caja ajustada con unos pocos píxeles de margen enseña el patrón completo del defecto y nada más. Si la recortas, falta una parte del patrón. Si la dejas holgada, el modelo tiene que aprender a ignorar todo ese fondo, y eso requiere más ejemplos de los que nadie quiere etiquetar. Además, una caja ajustada es más rápida de dibujar, y eso nunca está de más.

    3. Etiqueta siempre de la misma manera

    Pilar 3: cajas individuales, una caja para el grupo y el estilo mezclado que hay que evitar.

    Hay dos formas perfectamente válidas de manejar un grupo de defectos pequeños: ponerle una caja a cada uno o dibujar una sola caja alrededor del grupo. Las dos funcionan. Lo que no funciona es hacer un poco de cada una, porque entonces el modelo ve la misma situación etiquetada de dos maneras y no puede decidir. Elige la que a tu equipo le resulte más fácil hacer de forma consistente y déjala por escrito en algún lado.

    4. Las cajas superpuestas de defectos distintos están bien

    Pilar 4: la superposición parcial de rayadura y mancha está bien, la superposición casi total no.

    Una rayadura que pasa por encima de una mancha es lo más normal del mundo. Ponle caja a la rayadura, ponle caja a la mancha y deja que se superpongan. La superposición parcial no es ningún problema. Lo que hay que evitar son dos cajas de clases distintas casi exactamente una encima de la otra, porque entonces no hay forma de aprender a qué clase pertenecen los píxeles.

    5. Empieza con detalle, fusiona después

    Pilar 5: empieza con rayadura profunda, rayadura fina y marca de roce, y fusiónalas en rayadura si el modelo las confunde.

    Si no tienes claro si rayadura profunda, rayadura fina y marca de roce son una clase o tres, empieza con tres. Fusionar después es un clic. Separar una clase que juntaste significa volver a revisar todo. La señal de que llegó la hora de fusionar es cuando el modelo confunde una y otra vez dos clases entre sí, lo que suele significar que para la cámara se ven iguales aunque para ti signifiquen cosas distintas.

    En la práctica: cuatro cosas que aprendimos por las malas

    Los pilares son las reglas. Estas son las decisiones de criterio que solo aparecen cuando ya estás sentado dibujando cajas.

    Muchos defectos, una caja

    Consejo 1: muchas cajas pequeñas con defectos sin marcar frente a una caja que cubre todo el grupo.

    Poner quince cajitas alrededor de quince puntitos toma una eternidad, y más o menos en la caja once se te va a escapar uno. Lo sabemos porque nos pasó. Una caja honesta alrededor de todo el grupo es más rápida, y al modelo no le molesta. La consistencia le gana a las cajas pequeñas.

    Sé eficiente, no dogmático

    Consejo 2: una caja para el grupo y otra para el defecto aislado, frente a las dos alternativas peores.

    A veces la respuesta correcta es una caja para el grupo y otra para el defecto aislado. Sí, eso es mezclar estilos. Aun así es mejor que una caja enorme llena de fondo solo para atrapar el defecto aislado, o quince cajas individuales con tres defectos sin marcar. La regla que está debajo de todas las reglas es etiquetar de forma que la siguiente persona lo etiquetaría igual.

    Saca del dataset las muestras confusas

    Consejo 3: una muestra con defectos superpuestos que cinco personas etiquetarían distinto, frente a muestras limpias.

    Algunas imágenes simplemente no se pueden etiquetar de forma consistente. Tres defectos superpuestos, bordes que no se pueden separar, cinco personas que dibujarían cinco juegos de cajas distintos. Sácalas y no te sientas mal por eso. Un dataset limpio de doscientas imágenes vale más que uno ruidoso de mil, y el modelo igual va a detectar defectos superpuestos en producción. Lo que no debe es aprender de ellos.

    Mejor más fondo que cajas subjetivas

    Consejo 4: una caja con más fondo frente a dos personas que cortan de forma distinta una rayadura larga.

    Una rayadura larga puede ser una caja o seis cortas, y si lo dejas a criterio de cada persona vas a tener las dos cosas. Una caja con un poco más de fondo es igual para todos. Siempre que una decisión de etiquetado dependa de quién tiene el mouse, agranda la caja hasta que deje de depender.

    ¿Cuántas imágenes necesitas?

    Menos de las que crees, si son buenas. Para un tipo de defecto en un producto, entre 25 y 50 imágenes bien etiquetadas suelen alcanzar para un primer modelo que puedes poner en la línea y del que puedes aprender. Lo que suele hundir los proyectos no es tener pocas imágenes, sino tener cien imágenes etiquetadas de tres maneras distintas. Empieza en pequeño, etiqueta con cuidado, pruébalo y después agrega imágenes donde el modelo es más débil.

    Preguntas frecuentes

    ¿Qué es la anotación con cajas delimitadoras?

    Es dibujar un rectángulo alrededor de cada cosa que quieres que el modelo encuentre, en este caso cada defecto, para que aprenda cómo se ve y dónde suele aparecer. Es el tipo de anotación de imágenes más común en inspección visual.

    ¿La caja debe incluir fondo?

    Unos pocos píxeles de margen, no más. Lo suficiente para que el borde del defecto quede dentro de la caja, pero no tanto como para que el modelo tenga que aprender a ignorar lo que lo rodea.

    ¿Cómo etiqueto un defecto que está parcialmente oculto?

    Ponle caja a la parte que se ve, bien ajustada. No adivines el resto. Si la mayor parte está oculta, pregúntate si esa imagen debería estar en el dataset.

    ¿También etiqueto las piezas buenas?

    Sí, dejándolas sin caja. Las imágenes sin defectos y sin cajas le enseñan al modelo cómo se ve lo normal, y las necesitas tanto como las imágenes con defectos.

    ¿Qué pasa si dos personas no están de acuerdo con una etiqueta?

    Es una señal para cambiar la regla, no para elegir a un ganador. Agranda la caja, fusiona las clases o descarta la muestra hasta que ustedes dos la dibujen igual.

    Pruébalo con tus propias piezas

    La mejor forma de comprobar si algo de esto funciona es etiquetar 25 imágenes de algo de tu propia línea y entrenar un modelo con ellas. Prueba la demo, sin registro, en sesenta segundos o empieza gratis.

    Explore with AI

    Discuss this article with your favorite AI assistant

    Korbinian Kuusisto, CEO and founder of Enao Vision

    Escrito por

    Korbinian Kuusisto

    CEO & Founder, Enao Vision