2,58 millones de parámetros y 6,4 GFLOPs. Elegido tras comparar tres tamaños.
Imágenes originales generadas sintéticamente y anotadas a mano, con partición agrupada.
Categorías para palets, embalajes y dimensiones correctas o incorrectas.
Por imagen. Equivale a unos 145 fotogramas por segundo en una NVIDIA A100.
Arquitectura del modelo
El sistema de AURION divide la detección en tres bloques principales: extracción de características, fusión de información visual y predicción final.
Backbone
Extrae características relevantes de la imagen, como bordes, formas, texturas y patrones visuales útiles para detectar anomalías.
Neck
Une información de distintas resoluciones para mejorar la detección de objetos grandes y pequeños dentro de la escena logística.
Head
Realiza las predicciones finales: clase detectada, posición de la caja y nivel de confianza asociado a cada resultado.
Clases que detecta
Las seis clases permiten distinguir entre estado del palet, calidad del embalaje y corrección dimensional de la mercancía.
Cómo se entrenó el sistema
El entrenamiento se diseñó para exponer al modelo a distintas vistas, condiciones de iluminación y combinaciones de carga.
Se anotaron a mano 870 imágenes originales para cubrir las seis clases de AURION. La augmentación se aplica solo al conjunto de entrenamiento, nunca antes de partir los datos.
Se aplicó data augmentation para mejorar la capacidad de generalización ante cambios de ángulo, iluminación y disposición de la carga.
Se buscó mantener un número similar de ejemplos por clase para evitar sesgos fuertes en la predicción.
Recopilación de imágenes, labels y organización de las seis categorías principales.
Uso de GPU NVIDIA A100 para acelerar el proceso de entrenamiento del modelo.
Entrenamiento prolongado para ajustar detección, localización y clasificación.
Comparación entre YOLO11n, YOLO11s y YOLO11m en condiciones idénticas antes de fijar la arquitectura final.
Tres tamaños, el mismo resultado
Se entrenaron YOLO11n, YOLO11s y YOLO11m en condiciones idénticas: 150 épocas, 640 píxeles, paciencia 30 y semilla fija. Los tres quedan dentro de un punto de mAP50-95.
Precisión mAP50-95 sobre validación · barra completa = 1.000
El modelo grande aporta 0.003 sobre el pequeño, con ocho veces más parámetros: una diferencia dentro del ruido de un conjunto de validación de 130 imágenes. Se elige el nano porque un puesto de control industrial se beneficia de un modelo que corre en hardware modesto, y la capacidad extra no compra precisión medible en esta tarea.
Dónde poner el umbral de decisión
El umbral de confianza decide qué detecciones se aceptan. Subirlo reduce falsas alarmas, pero también deja escapar defectos. Mueve el control para ver el efecto medido.
La precisión apenas se mueve hasta 0.6, momento en que ya se pierde recall. El motivo está en los falsos positivos: su confianza media es de 0.532, así que no son detecciones dudosas que un umbral pueda filtrar, sino errores seguros de sí mismos. Como un falso positivo cuesta una revisión manual y un falso negativo deja pasar producto defectuoso, el punto de operación elegido mantiene el umbral bajo.
En qué se equivoca
449 errores sobre 127 imágenes de test. No se reparten al azar: hay un patrón claro y va en la dirección que más importa evitar.
El fallo dominante es palet dañado clasificado como palet en buen estado: 52 casos, frente a solo 6 en la dirección contraria. Sumando los 15 palets dañados no detectados, hay 67 casos en los que una paleta defectuosa supera el control. Esa asimetría revela un sesgo hacia declarar la mercancía correcta, que es justo la dirección desfavorable en control de calidad. Las confusiones entre clases de paquete se concentran en pares que comparten un atributo y difieren en el otro, lo que apunta a un problema en el diseño de las cuatro categorías.
De la arquitectura técnica a una demo funcional
La página del modelo explica la base técnica de AURION. El siguiente paso es probarlo con imágenes o vídeos para visualizar directamente sus predicciones.