Detección de anomalías y machine learning: cómo la IA aprende qué es normal

Lo más poderoso de la IA en seguridad no es que detecte amenazas. Es que aprende cómo se ve tu entorno cuando todo está bien.

Miguel Castro
Co-fundador, Closely
4 de agosto de 202618 min read
anomaly detection machine learningAI anomaly detectionmachine learning securityphysical security AI
Diagrama dividido con un modelo de machine learning en el centro: a la izquierda, cámaras de una bodega, un pasillo de colegio y un lobby residencial marcadas como patrón aprendido al 98% normal; a la derecha, feeds similares señalados como anomalías — una persona a las 3 AM, un vehículo detenido en zona restringida y alguien merodeando fuera de horario

No puedes detectar algo anormal de forma confiable si no tienes una definición precisa de lo normal. Los sistemas tradicionales de seguridad —sensores de movimiento, umbrales fijos, disparadores por reglas— aplican definiciones estáticas que se caen en entornos donde la actividad normal es compleja y depende del contexto. La detección de anomalías con machine learning reemplaza esas reglas estáticas por patrones aprendidos: el sistema observa cada cámara en el tiempo, aprende cómo se ve lo normal en cada hora y marca las desviaciones. Ese cambio —de reglas definidas a mano a patrones que se actualizan solos— es lo que hace que la detección con IA sea mucho más precisa que las alternativas basadas en reglas.

Por qué "normal" es la palabra más importante en seguridad

Hay algo que suena obvio apenas lo escuchas pero que cambia por completo cómo piensas los sistemas de seguridad: no puedes detectar algo anormal de forma confiable si no tienes una definición precisa de lo normal.

Los sistemas tradicionales se construyen alrededor de definiciones estáticas de qué cuenta como problema. Un sensor de movimiento se dispara cuando algo se mueve. Una alarma de puerta se activa cuando se rompe un contacto. Un sensor de temperatura alerta cuando la lectura supera un techo fijo. Esas reglas funcionan en entornos simples y controlados donde las amenazas siempre se ven igual. Se caen rápido en entornos reales, donde la actividad normal es compleja, variable y depende del contexto.

Un muelle de carga en una bodega de Chicago se ve completamente distinto a las 9am de un martes que a las 3am de un domingo. Un pasillo de colegio tiene un patrón muy diferente en la hora de almuerzo que en clase o en un evento después de la jornada. El lobby de un edificio residencial en Bogotá se comporta distinto un martes en la mañana que un sábado en la noche. Una regla que marca "más de cinco personas cerca de la entrada" es inútil en un lobby que rutinariamente tiene quince personas en hora pico y cero a las 2am.

La detección de anomalías con machine learning resuelve esto reemplazando las reglas estáticas por patrones aprendidos. En vez de que alguien defina manualmente qué es sospechoso, el sistema observa el entorno en el tiempo, aprende cómo se ve lo normal en cada ubicación y a cada hora, y marca las desviaciones de ese patrón aprendido. La definición de "anormal" pasa a ser dinámica, contextual y actualizada de forma continua.

Cómo funciona realmente la detección de anomalías con machine learning

Aprender el patrón base: el cimiento de todo

Todo sistema de detección de anomalías arranca con el mismo paso fundamental: establecer cómo se ve lo normal. A eso se le llama la línea base, y construirla es donde el machine learning hace el trabajo pesado.

En un sistema de cámaras, construir la línea base significa procesar grandes volúmenes de video histórico de cada ubicación —horas, días, semanas— y aprender la distribución estadística de todo lo que ve la cámara. ¿Cuántas personas pasan típicamente por este cuadro a esta hora? ¿Qué velocidades y direcciones de movimiento son normales? ¿Qué tipos de objetos suelen estar presentes? ¿Cómo cambia la escena entre el día y la noche, entre semana y fin de semana, entre periodos de alto y bajo tráfico?

Los modelos que hacen este trabajo —normalmente redes neuronales convolucionales para reconocimiento visual, combinadas con modelos temporales que entienden cómo cambian las escenas— construyen un modelo rico y multidimensional de lo normal en cada cámara. No es un umbral único. Es un retrato estadístico complejo que varía de forma continua con el tiempo, el contexto y las condiciones del entorno.

Una vez establecida la línea base, la detección se vuelve un problema de comparación: ¿cómo se compara lo que la cámara ve ahora con lo que aprendió a esperar en esta ubicación, a esta hora, en estas condiciones? Los eventos dentro de la distribución esperada no generan alerta. Los que se desvían significativamente se marcan.

El pipeline de detección en tres capas

El reto arquitectónico está en balancear precisión contra costo y velocidad. Correr un modelo sofisticado sobre cada cuadro de cada cámara de forma continua daría los resultados más precisos —y sería prohibitivamente caro y lento en flotas grandes de cámaras.

La solución que funciona en producción es un pipeline en cascada, donde el análisis más sofisticado se aplica solo a los eventos que pasan filtros previos más simples:

Capa 1 — Detección de movimiento y cambio. Visión computacional básica identifica los cuadros donde la escena cambió respecto al fondo estático. Esto filtra de inmediato la gran mayoría del video: si nada cambió, no hay nada que analizar. Es barato en cómputo y extremadamente rápido.

Capa 2 — Detección y clasificación de objetos. Un modelo dedicado analiza los cuadros que pasaron la capa 1 y determina si el cambio involucra un objeto relevante: una persona, un vehículo, un objeto de interés. Esto filtra falsos positivos por cambios ambientales (variaciones de luz, clima, reflejos) y movimiento irrelevante (animales, movimiento mecánico). Solo avanzan los cuadros con objetos relevantes.

Capa 3 — Razonamiento de comportamiento y puntaje de anomalía. La capa más sofisticada, donde se aplica razonamiento contextual. Dado lo que esta cámara aprendió de su ubicación, dada la hora, dado el comportamiento del objeto detectado en los últimos minutos: ¿es este evento anómalo? El modelo asigna un puntaje de confianza y solo los eventos por encima de cierto umbral generan alerta.

Esta arquitectura en cascada es lo que hace la detección con IA económicamente viable a escala. El razonamiento costoso de la capa 3 solo procesa una fracción pequeña del video total —los eventos que ya pasaron dos rondas de filtrado. Los costos de inferencia se mantienen manejables sin sacrificar precisión.

Qué convierte a un evento en anomalía

En seguridad física, los eventos que se marcan se desvían del patrón aprendido de formas significativas. En la práctica, esto incluye cuatro categorías:

Anomalías temporales — actividad en momentos estadísticamente inesperados. Una persona en una bodega a las 3am cuando el edificio nunca ha tenido presencia humana a esa hora. Un vehículo en un parqueadero mucho después de la última salida autorizada.

Anomalías de comportamiento — patrones de actividad que se desvían de lo esperado para esa ubicación. Una persona quieta donde la gente normalmente pasa de largo (merodeo). Alguien moviéndose en contra del flujo establecido de ese espacio.

Anomalías de frecuencia — eventos que ocurren más o menos seguido de lo que predice la línea base. Diez personas en un punto de acceso donde el pico normal son dos o tres. Cero personas en un espacio que normalmente está ocupado a esa hora.

Anomalías de objeto — tipos de objetos que no son parte normal de la escena. Un paquete dejado donde nunca se dejan objetos. Un tipo de vehículo que no encaja con el perfil de ese parqueadero.

Lo sofisticado de los sistemas modernos es que estos tipos se detectan de forma simultánea, contextual y con confianza probabilística en vez de disparadores binarios —que es lo que produce alertas usables en lugar de avalanchas de alarmas.

Por qué el machine learning le gana a los sistemas de reglas

El argumento a favor del machine learning no es solo precisión: es sostenibilidad operativa.

Los sistemas de reglas exigen que alguien defina manualmente cada regla. Los expertos en seguridad tienen que anticipar cada escenario posible, traducirlo a una condición específica y mantener esas reglas actualizadas a medida que los entornos cambian, las amenazas evolucionan y las necesidades operativas se mueven. En un entorno complejo y dinámico esa es una batalla interminable que a la larga se pierde. Las reglas que funcionan hoy fallan cuando aparecen condiciones que nadie anticipó.

Los sistemas de machine learning aprenden las reglas desde los datos en vez de tenerlas escritas a mano. Cuando el entorno cambia —un nuevo flujo de trabajo en una bodega, un nuevo inquilino en un edificio de oficinas, un cambio estacional en el tráfico— el modelo actualiza su línea base sin reconfiguración manual. Cuando surgen nuevos patrones de amenaza, el modelo detecta la desviación de lo normal aunque no exista una regla específica para ese caso.

Esa capacidad de adaptación es lo que hace la detección con IA cada vez más indispensable en entornos complejos con muchas cámaras, muchas ubicaciones y condiciones cambiantes —exactamente los entornos que manejan hoy los operadores de seguridad más grandes en Estados Unidos y Latinoamérica. Es también el mecanismo detrás de reducir la fatiga por falsas alarmas, que es la mayor fuga de atención en la mayoría de centrales de monitoreo.

Según el World Security Report 2026, el 44% de los directores de seguridad a nivel global clasifican la detección de amenazas con IA como crucial para sus operaciones en los próximos dos años —ubicándola entre las tres principales prioridades tecnológicas junto con la videovigilancia con IA y la detección de intrusiones con IA. La señal entre 2.352 líderes de seguridad en 31 países es consistente: la detección de anomalías con machine learning ya no es una capacidad diferenciadora. Se está volviendo una expectativa básica.

Dónde se está aplicando la detección de anomalías

Centrales de monitoreo

La central de monitoreo es donde la detección con IA tiene el impacto operativo más inmediato. Una central mediana que maneja 500 cámaras en 20 sitios de clientes genera un volumen enorme de eventos cada día. Sin filtrado con machine learning, los operadores enfrentan un flujo de alertas que no pueden procesar de forma significativa —y el resultado es fatiga de alertas, detecciones perdidas y calidad de respuesta inconsistente.

El machine learning transforma ese flujo de trabajo. En vez de que los operadores vean feeds crudos y juzguen en tiempo real cada evento de movimiento, el sistema pre-filtra usando los patrones aprendidos de cada cámara. Lo que llega al operador es un conjunto curado de anomalías reales —eventos que el modelo determinó que son significativamente distintos de lo que esa cámara ve normalmente a esa hora.

El resultado operativo es que los operadores dedican su tiempo a decidir, no a filtrar. La calidad de respuesta mejora porque la atención se dirige donde realmente hace falta. La cobertura escala sin crecer el equipo en la misma proporción, que es la restricción central detrás de por qué las centrales de monitoreo no logran escalar.

Instalaciones industriales y logísticas

Las instalaciones industriales grandes —plantas de manufactura, centros logísticos, puertos— tienen entornos con patrones operativos complejos y variables que vuelven casi inútil la detección por reglas. La misma zona con alto tráfico legítimo durante un turno tiene cero actividad autorizada entre turnos. Los patrones del muelle de carga varían por día, por temporada, por programación operativa.

El machine learning encaja particularmente bien acá porque aprende los patrones específicos de cada instalación en vez de aplicar reglas genéricas. Una anomalía en una bodega se define respecto a cómo se ve esa bodega en condiciones normales —no respecto a un referente genérico de la industria.

Seguridad residencial y administración de edificios

En seguridad residencial —sobre todo en LATAM, donde edificios y conjuntos cerrados dependen de empresas de seguridad para el monitoreo remoto— la detección con IA permite que centrales centralizadas monitoreen decenas de edificios sin personal dedicado por edificio.

Las cámaras de cada edificio desarrollan su propia línea base: cómo se ve el lobby a las 7am entre semana, cómo se ve la entrada del parqueadero en el pico de la tarde, cómo se ve el perímetro a las 2am. Las anomalías se detectan respecto a esos patrones específicos de cada edificio —una persona en el lobby a una hora inusual en un edificio genera una alerta distinta que la misma escena en otro donde ese patrón es normal.

Retail y propiedades comerciales

El retail se beneficia de sistemas que aprenden los patrones de tráfico y comportamiento de cada tienda. La definición de comportamiento sospechoso es muy específica de cada ubicación: lo normal en una tienda insignia en Miami no es lo normal en un formato pequeño en Medellín. Un grupo de gente cerca de la salida es normal a la hora de cierre; el mismo grupo 30 minutos antes de abrir no lo es.

La misma detección que identifica patrones de hurto también entrega analítica de comportamiento —flujos de tráfico, tiempos de permanencia por zona, comportamientos relevantes para conversión— con valor más allá de la seguridad pura.

Cómo implementa Closely la detección de anomalías

Closely está construido sobre la arquitectura descrita arriba —no como marco teórico, sino como el núcleo operativo de cómo la plataforma entrega inteligencia de seguridad.

El pipeline de tres capas de Closely —trigger de movimiento, luego visión computacional con YOLOv8, luego razonamiento con Claude Vision— implementa la arquitectura en cascada que hace viable la detección a escala. La capa de razonamiento evalúa cada evento marcado contra lo que es normal en esa cámara específica. Las reglas de detección se configuran por cámara en lenguaje natural, así que la línea base refleja cómo opera realmente cada ubicación en vez de una plantilla genérica.

Cada alerta pasa por un operador humano que la valida antes de despachar. El resultado es un flujo de alertas pre-calificadas donde las anomalías reales llegan al operador con el contexto necesario para decidir —no una avalancha indiferenciada.

Cada anomalía genera un registro estructurado del incidente: ubicación de la cámara, fecha y hora, tipo de anomalía, puntaje de confianza, evidencia visual, respuesta del operador y desenlace. Esos registros se acumulan en toda la flota de cámaras del operador y crean una capa de inteligencia operativa que se compone en el tiempo. Las detecciones individuales sirven para la respuesta inmediata. Los datos agregados de cientos de sitios durante meses revelan patrones que informan decisiones estratégicas: qué sitios tienen mayor frecuencia de anomalías, qué franjas horarias son consistentemente de mayor riesgo, qué tipos de detección están sobrerrepresentados en ciertos clientes.

Closely se conecta a través de tu NVR existente —Dahua, Hikvision, Milestone o cualquier sistema compatible con RTSP— así que la capa de detección funciona sobre las cámaras que ya tienes.

Si manejas una central de monitoreo en Estados Unidos o Latinoamérica y estás evaluando si la IA va a hacer tu operación realmente más efectiva o solo va a generar otro tipo de ruido, contáctanos.

Preguntas frecuentes

¿Qué es la detección de anomalías en seguridad física y cómo la hace posible el machine learning?

La detección de anomalías en seguridad es el proceso de identificar eventos o comportamientos que se desvían significativamente de lo esperado en un entorno determinado, en un momento determinado. El machine learning lo hace posible entrenando modelos con video histórico para construir una línea base estadística del comportamiento normal de cada ubicación, y luego comparando los eventos en tiempo real contra esa base. La ventaja clave frente a los sistemas de reglas es que la definición de lo normal se aprende de los datos y se actualiza de forma continua, en vez de definirse a mano y quedarse fija.

¿Cuál es la diferencia entre alertas por reglas y detección de anomalías con machine learning?

Los sistemas de reglas usan disparadores fijos definidos manualmente: alertar cuando el movimiento supera un umbral, cuando una puerta lleva más de 60 segundos abierta, cuando hay más de N personas en una zona. Los sistemas de machine learning aprenden qué es normal en cada ubicación específica y marcan las desviaciones, incluso cuando no existe una regla para ese caso. En la práctica, los sistemas de reglas generan volúmenes enormes de falsos positivos y se pierden amenazas nuevas, mientras que los de machine learning se adaptan a entornos variables con una relación señal-ruido mucho mejor.

¿Cuánto tarda un sistema de machine learning en aprender el patrón de una cámara?

El periodo de aprendizaje varía según el sistema y la complejidad del entorno, pero la mayoría de plataformas requieren entre una y cuatro semanas de observación para construir una línea base confiable en una cámara típica. Los entornos complejos con alta variabilidad —patrones estacionales, horarios muy cambiantes— se benefician de periodos más largos. Durante la fase de aprendizaje, los sistemas suelen operar en modo observación, registrando detecciones sin generar alertas completas, hasta que el modelo tiene datos suficientes para evaluar de forma confiable.

¿Qué tipos de anomalías puede detectar el machine learning?

Los sistemas modernos identifican anomalías temporales (actividad en horarios inesperados), de comportamiento (patrones de movimiento inusuales, merodeo, movimiento contra el flujo), de frecuencia (más o menos personas y objetos de lo esperado) y de objeto (tipos de objetos inesperados o elementos abandonados). La capacidad específica depende de los datos de entrenamiento y la arquitectura del modelo. Las plataformas maduras combinan varios tipos de detección en un marco de puntuación unificado en vez de tratar cada tipo por separado.

¿Cómo maneja la detección de anomalías los entornos donde lo normal cambia con el tiempo?

Los buenos sistemas usan actualización continua o periódica de la línea base: el modelo no congela el patrón al terminar el aprendizaje inicial, sino que lo sigue actualizando mientras observa más datos. Esto significa que el sistema se adapta cuando los patrones cambian: llega un nuevo inquilino a un edificio de oficinas, una bodega cambia sus horarios, un pico estacional altera el tráfico de una tienda. La adaptación suele ser gradual, con promedios ponderados en el tiempo que dan más peso a lo reciente sin perder los patrones de largo plazo.

¿Cuál es la tasa de falsos positivos en la detección con IA y cómo se gestiona?

Las tasas varían bastante según la arquitectura y la calidad del despliegue. El mecanismo principal de gestión es el pipeline en cascada: los eventos deben pasar filtrado de movimiento, clasificación de objetos y razonamiento de comportamiento antes de generar una alerta. El puntaje de confianza de la última capa permite ajustar la sensibilidad —umbrales más altos dan menos alertas pero de mayor confianza, umbrales más bajos capturan más eventos a costa de más falsos positivos. Para la mayoría de despliegues, un umbral que genere entre 10 y 20 alertas por operador por turno es un objetivo práctico.

¿Funciona la detección de anomalías con distintas cámaras y hardware de grabación?

Sí. Las plataformas que se conectan por protocolos estándar (RTSP y ONVIF) funcionan con cualquier cámara IP que entregue un stream de video, sin importar el fabricante. Closely se conecta a Dahua, Hikvision, Milestone y cualquier sistema compatible con RTSP. Los modelos operan sobre el stream de video, no sobre datos propietarios de la cámara, así que la capacidad es agnóstica al hardware. La resolución y los cuadros por segundo sí afectan la precisión —más es generalmente mejor— pero el marco de aprendizaje funciona sobre una flota heterogénea.

¿Cómo se está usando la detección de anomalías con machine learning en Latinoamérica?

En Latinoamérica la despliegan principalmente operadores de seguridad que manejan edificios residenciales, propiedades comerciales e instalaciones industriales desde centrales de monitoreo. El reto operativo —cientos de cámaras en decenas de sitios de clientes con personal limitado— es exactamente lo que esta tecnología resuelve. La adopción se está acelerando en Colombia, México, Brasil y Chile, impulsada por el alza de costos laborales, el crecimiento del parque de cámaras y operadores buscando diferenciar su servicio. Según el World Security Report 2026, los directores de seguridad de LATAM califican la detección de amenazas con IA como crucial en un 46% —por encima del promedio global de 44%.

¿Qué datos genera la detección de anomalías y sirven más allá de la respuesta inmediata?

Cada anomalía genera un registro estructurado: fecha y hora, ubicación de la cámara, tipo de anomalía, puntaje de confianza, evidencia visual y datos de respuesta. A escala, esos datos tienen valor más allá de la respuesta inmediata. Agregados en toda una red de cámaras, revelan patrones de riesgo por ubicación, hora y tipo de evento que sirven para decisiones estratégicas de despliegue, reportes de SLA a clientes y documentación de cumplimiento. A mayor escala habilitan productos de datos institucionales como insumos para suscripción de riesgos en seguros y puntajes de seguridad logística.

¿Qué debo mirar al comparar plataformas de IA en detección de anomalías?

Mira más allá de la promesa de detección. Haz tres preguntas: ¿la plataforma aprende una línea base por cámara o aplica reglas genéricas a toda la flota?; ¿cada alerta pasa por validación humana antes de despachar?; ¿genera registros estructurados que puedas consultar después? Muchas plataformas se enfocan solo en mostrar alertas. La diferencia que importa en la operación es si la detección alimenta un flujo de trabajo —priorización, validación con humano en el circuito, documentación estructurada— o simplemente agrega otro stream que tus operadores tienen que triar.

Miguel Castro
Co-fundador, Closely
Closely · Bogotá, Colombia

Closely

Ve Closely en acción.

Reserva una demo y descubre cómo los agentes de IA transforman tus operaciones de seguridad — detección, despacho e informes en una sola plataforma.

Solicitar demo