¿Qué es la visión por computadora y cómo funciona?
Cómo una computadora representa imágenes mediante números, qué diferencias existen entre clasificación, detección y segmentación, cómo se entrenan los modelos visuales y qué factores afectan sus resultados.
Cuando una persona observa una fotografía puede reconocer objetos, leer palabras o distinguir personas casi inmediatamente. Para una computadora, en cambio, una imagen comienza siendo información numérica. La visión por computadora busca transformar esos datos en resultados útiles.
¿Qué es la visión por computadora?
La visión por computadora es un área de la informática y la inteligencia artificial dedicada a desarrollar sistemas capaces de obtener información a partir de imágenes y videos.
Dependiendo de la tarea, un sistema puede intentar responder preguntas como:
- ¿Qué aparece en esta imagen?
- ¿Dónde se encuentra determinado objeto?
- ¿Qué píxeles pertenecen a cada elemento?
- ¿Qué texto aparece en una fotografía?
- ¿Cómo se mueve un objeto a través de un video?
Por eso la visión por computadora no es una única tecnología ni una sola tarea. Incluye diferentes técnicas y problemas.
¿Cómo interpreta una computadora una imagen?
Una imagen digital está formada por píxeles. Cada píxel contiene valores numéricos que representan información visual.
En una imagen en escala de grises, por ejemplo, un valor puede representar qué tan oscuro o claro es un píxel.
En una imagen RGB se utilizan normalmente tres componentes:
- Rojo.
- Verde.
- Azul.
Píxel RGB
Rojo: 255
Verde: 0
Azul: 0
Resultado aproximado:
rojo intenso
Una fotografía contiene una gran cantidad de estos valores organizados en una estructura.
Recibe valores numéricos. El sistema necesita aprender o aplicar reglas para relacionar determinados patrones visuales con conceptos útiles.
¿Cómo funciona la visión por computadora?
El proceso depende de la aplicación, pero un flujo simplificado puede representarse así:
Imagen o video
↓
Preprocesamiento
↓
Modelo o algoritmo
↓
Predicción
↓
Evaluación o acción
1. Entrada
El sistema recibe una fotografía, una secuencia de video u otra información visual.
2. Preprocesamiento
La imagen puede cambiar de tamaño, normalizar sus valores o recibir otras transformaciones necesarias para el modelo.
3. Análisis
Un algoritmo o modelo procesa los datos y busca patrones relevantes para la tarea.
4. Predicción
El sistema produce un resultado: una categoría, coordenadas, regiones, texto reconocido u otra salida.
5. Uso del resultado
Finalmente, otra parte de la aplicación utiliza esa predicción.
Clasificación de imágenes
La clasificación intenta determinar a qué categoría pertenece una imagen.
Por ejemplo:
Entrada:
fotografía de una fruta
Salida:
"manzana"
El modelo puede producir además puntuaciones o probabilidades para diferentes categorías.
manzana: 0.91
pera: 0.06
naranja: 0.03
La clasificación normalmente responde qué aparece principalmente en la imagen, pero no necesariamente indica dónde se encuentra.
Detección de objetos
La detección de objetos intenta identificar objetos y localizar dónde aparecen.
Una salida simplificada podría ser:
Objeto: persona
Ubicación: [x1, y1, x2, y2]
Objeto: bicicleta
Ubicación: [x1, y1, x2, y2]
Las coordenadas pueden utilizarse para dibujar un rectángulo alrededor del objeto, conocido como bounding box.
Clasificación vs detección
Si una fotografía contiene tres automóviles:
- La clasificación podría indicar simplemente que la imagen contiene automóviles.
- La detección puede intentar localizar cada automóvil por separado.
Segmentación de imágenes
La segmentación busca determinar qué píxeles pertenecen a determinadas regiones u objetos.
En lugar de dibujar solamente un rectángulo, el sistema intenta identificar la forma con mayor detalle.
Segmentación semántica
Asigna una categoría a los píxeles.
Píxeles del cielo → "cielo"
Píxeles de carretera → "carretera"
Píxeles de vehículo → "vehículo"
Segmentación de instancias
Además de reconocer la categoría, intenta distinguir diferentes objetos individuales de la misma clase.
Por ejemplo, podría separar tres personas diferentes aunque todas pertenezcan a la categoría “persona”.
Reconocimiento óptico de caracteres
El OCR permite extraer texto presente en imágenes o documentos escaneados.
Por ejemplo:
Fotografía:
"ByteNova 2026"
↓ OCR
Texto:
ByteNova 2026
Esta tecnología puede utilizarse para digitalizar documentos, leer formularios o hacer que determinados contenidos visuales sean más accesibles.
Sin embargo, factores como tipografía, resolución, inclinación, iluminación y calidad de la imagen pueden afectar el reconocimiento.
¿Cómo se analiza un video?
Un video puede entenderse como una secuencia de imágenes o fotogramas mostrados rápidamente.
Un sistema puede analizar fotogramas individuales, pero muchas tareas también necesitan comprender cómo cambia la escena con el tiempo.
Seguimiento de objetos
Después de detectar un objeto, el sistema puede intentar mantener su identidad entre diferentes fotogramas.
Fotograma 1 → vehículo A
Fotograma 2 → vehículo A
Fotograma 3 → vehículo A
Esto puede utilizarse para analizar movimiento, trayectorias o permanencia dentro de determinadas zonas.
Procesamiento en tiempo real
Algunas aplicaciones necesitan producir resultados casi inmediatamente. En estos casos importan no solamente la calidad del modelo, sino también la velocidad de procesamiento y la latencia.
¿Cómo se entrena un modelo visual?
En aprendizaje supervisado necesitamos ejemplos y etiquetas relacionadas con la tarea.
Imagina que queremos clasificar fotografías de manzanas y naranjas.
1. Reunir datos
Necesitamos imágenes representativas de ambas categorías.
2. Etiquetar
imagen_001.jpg → manzana
imagen_002.jpg → naranja
imagen_003.jpg → manzana
3. Separar los datos
Es habitual separar datos para entrenamiento, validación y prueba.
- Entrenamiento: permite ajustar el modelo.
- Validación: ayuda a evaluar decisiones durante el desarrollo.
- Prueba: permite estimar el rendimiento final con ejemplos no utilizados para entrenar.
4. Entrenar
El modelo ajusta sus parámetros intentando reducir sus errores sobre los ejemplos de entrenamiento.
5. Evaluar
Después debemos comprobar cómo funciona con datos que no utilizó para aprender.
Un modelo puede funcionar muy bien con las imágenes de entrenamiento y fallar con fotografías nuevas. El objetivo es que pueda generalizar a situaciones representativas del uso real.
CNN y modelos visuales modernos
Durante años, las redes neuronales convolucionales (CNN) han sido una arquitectura fundamental para muchas tareas de visión por computadora.
De manera conceptual, estas redes aprenden representaciones visuales útiles a partir de los datos, pasando desde patrones relativamente simples hacia características más complejas.
Actualmente también existen arquitecturas visuales basadas en transformers y modelos que pueden relacionar imágenes con lenguaje.
Para empezar no es necesario memorizar todas las arquitecturas. Es más importante comprender que diferentes modelos transforman los píxeles en representaciones que luego utilizan para resolver una tarea.
¿Cómo sabemos si un modelo funciona bien?
Decir que un modelo tiene “buena precisión” no siempre es suficiente. La métrica adecuada depende del problema.
Exactitud
En una clasificación sencilla puede medirse qué proporción de predicciones fue correcta.
Falso positivo
Ocurre cuando el sistema indica que algo está presente cuando en realidad no lo está.
Falso negativo
Ocurre cuando el sistema no detecta algo que sí estaba presente.
Problema:
detectar defectos en productos
Falso positivo:
producto correcto marcado como defectuoso
Falso negativo:
producto defectuoso marcado como correcto
Dependiendo de la aplicación, uno de estos errores puede ser mucho más costoso que el otro.
En detección y segmentación se utilizan además métricas específicas que consideran la localización o superposición de las predicciones.
¿Dónde se utiliza la visión por computadora?
Industria
Puede utilizarse para inspeccionar productos y detectar determinados defectos visuales.
Agricultura
Las imágenes pueden ayudar a analizar cultivos, plantas y condiciones visibles del terreno.
Documentos
El OCR y otras técnicas permiten extraer y organizar información de documentos escaneados.
Accesibilidad
Los sistemas visuales pueden describir determinadas imágenes, reconocer texto o ayudar a interpretar contenido visual.
Comercio
Puede utilizarse para búsqueda visual, clasificación de productos y organización de catálogos.
Salud
Existen aplicaciones para apoyar el análisis de imágenes médicas. En contextos de alto impacto, estos sistemas requieren validación rigurosa y supervisión profesional.
Limitaciones de los sistemas visuales
Un modelo puede funcionar correctamente durante las pruebas y encontrar dificultades cuando cambian las condiciones.
Iluminación
Sombras, reflejos o cambios de brillo pueden modificar considerablemente una imagen.
Ángulo
Un objeto observado desde una posición diferente puede verse muy distinto.
Oclusiones
Una parte del objeto puede quedar escondida detrás de otro elemento.
Calidad de imagen
Desenfoque, compresión o baja resolución pueden eliminar información útil.
Diferencias entre entrenamiento y realidad
Si las imágenes utilizadas para entrenar no representan las condiciones reales, el rendimiento puede disminuir.
Datos insuficientes
Un conjunto pequeño o poco diverso puede hacer que el modelo aprenda patrones demasiado específicos.
Privacidad, sesgos y uso responsable
Trabajar con imágenes puede implicar información sensible, especialmente cuando aparecen personas, documentos, ubicaciones o espacios privados.
Privacidad
Antes de recopilar o procesar imágenes debemos considerar qué datos contienen, para qué se utilizarán y durante cuánto tiempo se conservarán.
Sesgos
Si determinados escenarios o grupos están poco representados en los datos, el rendimiento puede variar entre diferentes condiciones.
Vigilancia
La posibilidad técnica de analizar personas o espacios no significa que cualquier uso sea apropiado. Deben considerarse finalidad, proporcionalidad, seguridad y normativa aplicable.
Decisiones importantes
En contextos donde una predicción pueda afectar significativamente a una persona, no debería asumirse que el resultado del modelo es infalible.
Ejemplo completo: clasificador de frutas
Imagina que queremos construir un sistema capaz de distinguir manzanas y naranjas.
Paso 1: definir el problema
La entrada será una fotografía y la salida será una de dos categorías:
manzana
naranja
Paso 2: recopilar imágenes
Necesitamos ejemplos variados: diferentes tamaños, fondos, iluminaciones y posiciones.
Paso 3: revisar etiquetas
Una etiqueta incorrecta enseña al modelo información equivocada, por lo que la calidad de los datos es importante.
Paso 4: separar datos
Reservamos imágenes que el modelo no utilizará directamente durante el entrenamiento.
Paso 5: entrenar
El modelo aprende patrones relacionados con las categorías.
Paso 6: probar
Presentamos fotografías nuevas.
Imagen nueva
Predicción:
manzana → 0.94
naranja → 0.06
Paso 7: analizar errores
Si falla especialmente con poca iluminación, no basta con decir que “el modelo se equivocó”. Debemos investigar si el conjunto de datos representa correctamente esa condición.
Paso 8: probar en condiciones reales
Antes de utilizarlo debemos comprobar su comportamiento en el entorno donde realmente funcionará.
La cámara, los datos, el preprocesamiento, el hardware, las métricas y las condiciones reales también afectan el resultado final.
Compruébalo tú mismo
No necesitas entrenar un modelo para realizar este ejercicio.
Imagina que debes crear un sistema para detectar botellas en una cinta transportadora.
Responde estas preguntas:
- ¿Necesitas clasificación, detección o segmentación?
- ¿Qué cambios de iluminación podrían ocurrir?
- ¿Las botellas pueden aparecer parcialmente ocultas?
- ¿Qué ocurriría si el sistema no detecta una botella?
- ¿Qué tipo de imágenes necesitarías para probarlo?
Ver una posible respuesta
Si necesitamos localizar cada botella, la detección de objetos puede ser una opción más apropiada que una clasificación de la imagen completa.
El conjunto de datos debería representar las condiciones reales: diferentes posiciones, iluminación, fondos y posibles oclusiones.
También deberíamos definir qué consecuencias tienen los falsos positivos y falsos negativos para elegir cómo evaluar el sistema.
Piensa cómo cambiaría el problema si además necesitáramos conocer la forma exacta ocupada por cada botella. En ese caso la segmentación podría ser útil.
Preguntas frecuentes
¿La visión por computadora es lo mismo que reconocimiento facial?
No. El reconocimiento facial es solamente una aplicación específica dentro del campo mucho más amplio de la visión por computadora.
¿La visión por computadora necesita siempre deep learning?
No. Existen técnicas tradicionales de procesamiento de imágenes y visión artificial. Sin embargo, el deep learning se utiliza ampliamente en muchas tareas modernas.
¿Puede analizar video en tiempo real?
Sí, siempre que el modelo, el hardware y el sistema puedan procesar los fotogramas con la velocidad y latencia necesarias.
¿Una imagen de alta resolución garantiza mejores resultados?
No. También influyen la iluminación, el enfoque, el encuadre, las oclusiones, los datos de entrenamiento y las condiciones reales de uso.
Del píxel al resultado: qué ocurre en un sistema de visión
Un sistema de visión por computadora recibe imágenes o video como datos. Antes de producir un resultado puede ser necesario preparar las imágenes, ejecutar un modelo y transformar su salida en una decisión útil para la aplicación.
La calidad de los datos importa
Iluminación, resolución, ángulo, cámaras y variedad de ejemplos pueden influir en el desempeño. Un modelo que funciona bien con las imágenes utilizadas durante el desarrollo puede fallar cuando el entorno real es diferente.
Privacidad y contexto
Cuando las imágenes contienen personas o información sensible, además de la precisión deben considerarse privacidad, permisos, almacenamiento y finalidad del sistema. Una predicción automática tampoco debería tratarse como infalible en decisiones importantes.
Reconocer patrones visuales no equivale a comprender una escena exactamente como lo hace una persona. Los resultados dependen del modelo, los datos y las condiciones en que se utiliza.
Conclusión
La visión por computadora permite transformar imágenes y videos en información que una aplicación puede utilizar.
Dependiendo del problema, un sistema puede clasificar una imagen, localizar objetos, identificar regiones, extraer texto o analizar cambios a través de una secuencia de video.
Sin embargo, construir un sistema visual útil requiere mucho más que entrenar un modelo. La calidad y diversidad de los datos, las etiquetas, las condiciones de iluminación, las métricas y el entorno real influyen directamente en el resultado.
También deben considerarse privacidad, sesgos y supervisión, especialmente cuando las imágenes contienen personas o cuando una predicción puede tener consecuencias importantes.
ByteNova
Proyecto educativo creado por Dylan Estrada. ByteNova publica contenido sobre programación, desarrollo web, inteligencia artificial y ciberseguridad con un enfoque claro para principiantes y revisión editorial continua.
Conoce más sobre ByteNova →