Articulo de referencia

Inteligencia artificial para videovigilancia

Detección de rostros en una fotografía La inteligencia artificial para videovigilancia utiliza programas informáticos que analizan el audio y las imágenes de las cámaras de vide...

Detección de rostros en una fotografía

La inteligencia artificial para videovigilancia utiliza programas informáticos que analizan el audio y las imágenes de las cámaras de videovigilancia para reconocer personas, vehículos, objetos, atributos y eventos. Las empresas de seguridad programan el software para definir áreas restringidas dentro del campo de visión de la cámara (como un área cercada, un estacionamiento, pero no la acera ni la calle pública fuera del estacionamiento) y programan horarios específicos (como después del cierre de negocios) para la propiedad protegida por la videovigilancia . La inteligencia artificial ("IA") envía una alerta si detecta a un intruso que infringe la "regla" establecida que prohíbe el acceso a esa área durante ese horario. [ 1 ]

El programa de IA funciona mediante visión artificial . La visión artificial consiste en una serie de algoritmos , o procedimientos matemáticos, que funcionan como un diagrama de flujo o una serie de preguntas para comparar el objeto observado con cientos de miles de imágenes de referencia almacenadas de personas en diferentes posturas, ángulos, posiciones y movimientos. La IA se pregunta si el objeto observado se mueve como en las imágenes de referencia, si tiene aproximadamente el mismo tamaño en relación con su altura y anchura, si posee la característica de dos brazos y dos piernas, si se mueve a una velocidad similar y si es vertical en lugar de horizontal. Son posibles muchas otras preguntas, como el grado de reflectividad del objeto, el grado de estabilidad o vibración y la suavidad de su movimiento. Al combinar todos los valores de las distintas preguntas, se obtiene una clasificación general que le da a la IA la probabilidad de que el objeto sea o no un ser humano. Si el valor supera un límite preestablecido, se envía una alerta. Es característico de este tipo de programas que, hasta cierto punto, sean autoaprendizajes , aprendiendo, por ejemplo, que las personas o los vehículos aparecen más grandes en ciertas partes de la imagen monitorizada —las zonas cercanas a la cámara— que en otras partes, que son las zonas más alejadas de la cámara.

Además de la regla simple que restringe el acceso de personas o vehículos a ciertas áreas en determinados momentos del día, se pueden establecer reglas más complejas. El usuario del sistema podría querer saber si los vehículos circulan en una dirección pero no en la otra. También podría querer saber si hay más de un número preestablecido de personas en un área determinada. La IA es capaz de mantener la vigilancia de cientos de cámaras simultáneamente. Su capacidad para detectar a un intruso a distancia, bajo la lluvia o con mucho resplandor es superior a la capacidad humana.

Este tipo de IA para seguridad se conoce como " basada en reglas " porque un programador humano debe establecer reglas para todas las alertas que el usuario desea recibir. Esta es la forma más común de IA para seguridad. Muchos sistemas de videovigilancia actuales incluyen este tipo de capacidad de IA. El disco duro que aloja el programa puede estar ubicado en las propias cámaras o en un dispositivo independiente que recibe la información de las cámaras.

Se ha desarrollado una nueva forma de IA para la seguridad, no basada en reglas, denominada " análisis de comportamiento ". Este software es completamente autoaprendizaje y no requiere programación inicial por parte del usuario ni del contratista de seguridad. En este tipo de análisis , la IA aprende el comportamiento normal de personas, vehículos, máquinas y el entorno a partir de la observación de patrones con diversas características, como tamaño, velocidad, reflectividad, color, agrupamiento, orientación vertical u horizontal, etc. La IA normaliza los datos visuales, lo que significa que clasifica y etiqueta los objetos y patrones que observa, creando definiciones cada vez más precisas del comportamiento normal o promedio para los distintos objetos observados. Tras varias semanas de aprendizaje, puede reconocer cuándo se rompe el patrón. Cuando detecta tales anomalías, envía una alerta. Por ejemplo, es normal que los coches circulen por la calle. Un coche que se sube a la acera sería una anomalía. Si un patio vallado suele estar vacío por la noche, una persona que entre en esa zona sería una anomalía.

Historia

Planteamiento del problema

Las limitaciones en la capacidad humana para monitorear atentamente las imágenes de videovigilancia en vivo impulsaron la demanda de inteligencia artificial que pudiera desempeñar mejor esta tarea. Los humanos que observan un solo monitor de video durante más de veinte minutos pierden el 95% de su capacidad para mantener la atención suficiente para discernir eventos significativos. [ 2 ] Con dos monitores, esta capacidad se reduce a la mitad nuevamente. [ 3 ] Dado que muchas instalaciones cuentan con docenas o incluso cientos de cámaras, la tarea está claramente más allá de la capacidad humana. En general, las vistas de las cámaras de pasillos vacíos, almacenes, estacionamientos o estructuras son extremadamente aburridas y, por lo tanto, la atención disminuye rápidamente. Cuando se monitorean varias cámaras, generalmente empleando un monitor de pared o un conjunto de monitores con vistas de pantalla dividida y rotando cada pocos segundos entre un conjunto de cámaras y el siguiente, el tedio visual se vuelve rápidamente abrumador. Si bien las cámaras de videovigilancia proliferaron con una gran adopción por parte de usuarios que van desde concesionarios de automóviles y centros comerciales hasta escuelas y empresas, e instalaciones de alta seguridad como centrales nucleares, se reconoció retrospectivamente que la videovigilancia por parte de agentes humanos (también llamados "operadores") era poco práctica e ineficaz. Los sistemas de videovigilancia a gran escala se limitaban a grabar para un posible uso forense con el fin de identificar a alguien tras un robo, incendio provocado, ataque o incidente. Cuando se empleaban cámaras de gran angular, sobre todo en grandes áreas exteriores, se descubrieron graves limitaciones incluso para este propósito debido a la insuficiente resolución. [ 4 ] En estos casos, es imposible identificar al intruso o al perpetrador porque su imagen es demasiado pequeña en el monitor. [ 5 ]

Intentos anteriores de solución

Cámaras de detección de movimiento

Ante la incapacidad de los guardias humanos para vigilar los monitores de vigilancia a largo plazo, la primera solución fue añadir detectores de movimiento a las cámaras. Se pensó que el movimiento de un intruso o agresor enviaría una alerta al operador de monitoreo remoto, eliminando la necesidad de vigilancia humana constante. El problema radicaba en que, en exteriores, existe un movimiento constante o cambios de píxeles que componen la imagen total en pantalla. El movimiento de las hojas de los árboles meciéndose con el viento, la basura en el suelo, los insectos, los pájaros, los perros, las sombras, los faros de los coches, los rayos del sol, etc., constituyen movimiento. Esto provocaba cientos o incluso miles de falsas alarmas diarias, lo que hacía que esta solución fuera inoperable, excepto en interiores y fuera del horario laboral.

Detección avanzada de movimiento de vídeo

La siguiente evolución redujo las falsas alarmas en cierta medida, pero a costa de una calibración manual compleja y laboriosa. En este caso, se detectan los cambios de un objetivo, como una persona o un vehículo, con respecto a un fondo fijo. Cuando el fondo varía estacionalmente o debido a otros factores, la fiabilidad disminuye con el tiempo. El coste económico de responder a demasiadas falsas alarmas volvió a ser un obstáculo, y esta solución resultó insuficiente.

El advenimiento del verdadero análisis de vídeo

El aprendizaje automático de reconocimiento visual se relaciona con patrones y su clasificación. [ 6 ] [ 7 ] El análisis de vídeo real puede distinguir la forma humana, vehículos y embarcaciones u objetos seleccionados del movimiento general de todos los demás objetos y el ruido visual o los cambios en los píxeles del monitor. Lo hace reconociendo patrones . Cuando el objeto de interés, por ejemplo una persona, infringe una regla preestablecida, por ejemplo, que el número de personas no debe superar cero en un área predefinida durante un intervalo de tiempo determinado, se envía una alerta. Normalmente, un rectángulo rojo o llamado "cuadro delimitador" seguirá automáticamente al intruso detectado, y se envía un breve videoclip de esto como alerta.

Aplicación práctica

Detección de peatones

Acción preventiva en tiempo real

La detección de intrusos mediante videovigilancia presenta limitaciones económicas y inherentes a las cámaras de vídeo. Generalmente, las cámaras exteriores se configuran con un ángulo de visión amplio, abarcando una gran distancia. La velocidad de fotogramas por segundo y el rango dinámico, que deben gestionar tanto zonas muy iluminadas como zonas con poca luz, dificultan aún más la detección de un intruso en movimiento. De noche, incluso en zonas exteriores iluminadas, un sujeto en movimiento no capta suficiente luz por fotograma y, por lo tanto, a menos que esté muy cerca de la cámara, aparecerá como una tenue silueta, un fantasma apenas perceptible o completamente invisible. El deslumbramiento, la obstrucción parcial, la lluvia, la nieve, la niebla y la oscuridad agravan el problema. Incluso cuando se le indica a una persona que observe la ubicación exacta del sujeto en el monitor en estas condiciones, normalmente no se detectará. La IA es capaz de analizar de forma imparcial la imagen completa y las imágenes de todas las cámaras simultáneamente. Mediante modelos estadísticos de grados de desviación de su patrón aprendido de la forma humana, detectará a un intruso con alta fiabilidad y una baja tasa de falsas alarmas, incluso en condiciones adversas. [ 8 ] Su aprendizaje se basa en aproximadamente un cuarto de millón de imágenes de humanos en diversas posiciones, ángulos, posturas, etc.

Una cámara de un megapíxel con análisis de vídeo integrado pudo detectar a una persona a una distancia de unos 107 metros y con un ángulo de visión de unos 30 grados en condiciones no ideales. Se podían establecer reglas para una "valla virtual" o para detectar intrusiones en un área predefinida. También se podían establecer reglas para la dirección del desplazamiento, los objetos que se dejan atrás, la formación de multitudes y otras condiciones. La inteligencia artificial para la videovigilancia se utiliza ampliamente en China. Véase Vigilancia masiva en China .

Hablar en contra

Una de las características más poderosas del sistema es que un agente u operador humano, al recibir una alerta de la IA, podía hablar inmediatamente con el intruso a través de altavoces exteriores. Esto tenía un alto valor disuasorio, ya que la mayoría de los delitos son oportunistas y el riesgo de ser capturado se acentúa tanto cuando una persona real le habla que es muy probable que desista de la intrusión y se retire. El agente de seguridad describiría las acciones del intruso para que este no tuviera ninguna duda de que una persona real lo estaba observando. El agente anunciaría que el intruso estaba infringiendo la ley, que se estaba contactando a las autoridades y que estaba siendo grabado en vídeo. [ 9 ]

Informe de violación de seguridad verificado

La policía recibe una enorme cantidad de falsas alarmas de sistemas antirrobo . De hecho, el sector de la seguridad informa que más del 98% de estas alarmas son falsas. Por consiguiente, la policía da muy poca prioridad a las alarmas antirrobo y puede tardar entre veinte minutos y dos horas en llegar al lugar. En cambio, el delito detectado mediante análisis de vídeo se notifica al operador de la central de monitoreo, quien verifica personalmente que se trata de un delito real en curso. Acto seguido, avisa a la policía, que da máxima prioridad a estas llamadas.

Análisis del comportamiento

Entornos activos

Si bien el análisis de video basado en reglas funcionó de manera económica y confiable para muchas aplicaciones de seguridad, existen muchas situaciones en las que no puede funcionar. [ 10 ] Para un área interior o exterior donde nadie debería estar durante ciertas horas del día, por ejemplo, durante la noche, o para áreas donde nadie debería estar en ningún momento, como una torre de telefonía celular , el análisis tradicional basado en reglas es perfectamente apropiado. En el ejemplo de una torre de telefonía celular, la rara vez que un técnico de servicio pueda necesitar acceder al área simplemente requeriría llamar con un código de acceso para poner la respuesta de monitoreo "en prueba" o inactivarla durante el breve tiempo que la persona autorizada estuviera allí.

Sin embargo, existen numerosas necesidades de seguridad en entornos dinámicos donde cientos o miles de personas se encuentran constantemente en diferentes lugares. Por ejemplo, un campus universitario, una fábrica en funcionamiento, un hospital o cualquier instalación operativa. No es posible establecer normas que discriminen entre personas honestas y delincuentes o infractores.

Superar el problema de los entornos activos

Mediante el análisis del comportamiento, una IA autodidacta, sin reglas predefinidas, toma los datos de las cámaras de vídeo y clasifica continuamente los objetos y eventos que observa. Por ejemplo, una persona cruzando la calle es una clasificación. Un grupo de personas es otra. Un vehículo es una clasificación, pero con el aprendizaje continuo se podría distinguir un autobús público de un camión pequeño y este último de una motocicleta. Con una mayor sofisticación, el sistema reconoce patrones en el comportamiento humano. Por ejemplo, podría observar que las personas pasan por una puerta de acceso controlado de una en una. La puerta se abre, la persona presenta su tarjeta de proximidad o etiqueta, pasa y la puerta se cierra. Este patrón de actividad, observado repetidamente, constituye la base de lo que se considera normal desde la perspectiva de la cámara que observa la escena. Ahora bien, si una persona autorizada abre la puerta, pero una segunda persona no autorizada la agarra antes de que se cierre y pasa, esa es la clase de anomalía que generaría una alerta. Este tipo de análisis es mucho más complejo que el análisis basado en reglas. Mientras que el análisis basado en reglas funciona principalmente para detectar intrusos en áreas donde normalmente no hay nadie presente en determinados momentos del día, el análisis de comportamiento funciona donde las personas están activas para detectar cosas que se salen de lo común.

Un incendio al aire libre sería un evento inusual y activaría una alerta, al igual que una columna de humo ascendente. Los vehículos que circulan en sentido contrario en una entrada de un solo sentido también serían un ejemplo típico de un evento con una fuerte señal visual y se desviarían del patrón observado repetidamente de vehículos que circulan correctamente en el carril. Que un atacante arroje a alguien al suelo sería un evento inusual que probablemente activaría una alerta. Esto depende de la situación. Por lo tanto, si la cámara observara un gimnasio donde se practica lucha libre, la IA aprendería que es habitual que una persona arroje a otra al suelo, en cuyo caso no activaría una alerta.

Lo que la inteligencia artificial "entiende"

La IA no sabe ni comprende qué es un ser humano, un fuego o un vehículo. Simplemente identifica las características de estos elementos basándose en su tamaño, forma, color, reflectividad, ángulo, orientación, movimiento, etc. Luego, descubre que los objetos que ha clasificado presentan patrones de comportamiento típicos. Por ejemplo, los humanos caminan por las aceras y, a veces, por las calles, pero no suelen trepar por las fachadas de los edificios. Los vehículos circulan por las calles, pero no por las aceras. Por lo tanto, el comportamiento anómalo de alguien escalando un edificio o de un vehículo desviándose hacia la acera activaría una alerta.

Se diferencia de la mentalidad tradicional de los sistemas de seguridad.

Los sistemas de alarma típicos están diseñados para detectar sin problemas los verdaderos positivos (eventos delictivos reales) y minimizar la tasa de falsas alarmas. En este sentido, las alarmas antirrobo detectan muy pocos verdaderos positivos, pero presentan una tasa de falsas alarmas muy alta, incluso en entornos interiores controlados. Las cámaras con detección de movimiento detectan algunos verdaderos positivos, pero sufren una gran cantidad de falsas alarmas en exteriores. Los análisis basados ​​en reglas detectan de forma fiable la mayoría de los verdaderos positivos y tienen una baja tasa de falsas alarmas, pero no funcionan en entornos con actividad, solo en entornos vacíos. Además, se limitan a la simple discriminación de la presencia o ausencia de un intruso.

Algo tan complejo o sutil como una pelea o que un empleado incumpla un procedimiento de seguridad no puede ser detectado ni discriminado por un análisis basado en reglas. Con el análisis de comportamiento, sí. Los lugares donde la gente se mueve y trabaja no presentan problemas. Sin embargo, la IA puede detectar muchas cosas que parecen anómalas pero que son inofensivas. Por ejemplo, si los estudiantes de un campus caminan por una plaza, se considerará normal. Si un par de estudiantes decidieran llevar una sábana grande al aire libre ondeando al viento, eso sí podría activar una alerta. El responsable de la monitorización sería alertado, revisaría su monitor y vería que el evento no representa una amenaza, por lo que lo ignoraría. El grado de desviación de la norma que activa una alerta se puede configurar para que solo se informen las cosas más anormales. Sin embargo, esto constituye una nueva forma de interacción entre humanos e IA que no se corresponde con la mentalidad tradicional de la industria de las alarmas. Esto se debe a que habrá muchas falsas alarmas que, no obstante, pueden ser valiosas para un agente humano que pueda observar rápidamente la situación y determinar si requiere una respuesta. En este sentido, es como un "toque en el hombro" de la IA para que el humano observe algo.

Limitaciones del análisis del comportamiento

Debido a que se procesan continuamente muchos datos complejos, el software realiza muestreos a una resolución muy baja de solo 1 CIF para ahorrar recursos computacionales. Esta resolución de 1 CIF implica que un objeto del tamaño de una persona no se detectará si la cámara utilizada es gran angular y la persona se encuentra a más de 18 a 24 metros de distancia, según las condiciones. Los objetos más grandes, como vehículos o humo, se detectarían a mayores distancias.

Cuantificación de la conciencia situacional

La utilidad de la inteligencia artificial para la seguridad no existe en el vacío, y su desarrollo no fue impulsado únicamente por estudios académicos o científicos. Más bien, responde a necesidades del mundo real y, por ende, a fuerzas económicas. Su uso para aplicaciones no relacionadas con la seguridad, como la eficiencia operativa, el mapeo de calor de compradores en áreas de exhibición (es decir, cuántas personas se encuentran en un área determinada en un espacio comercial) y la asistencia a clases, son usos en desarrollo. [ 11 ] Los humanos no están tan bien capacitados como la IA para recopilar y reconocer patrones que consisten en conjuntos de datos muy grandes que requieren cálculos simultáneos en múltiples ubicaciones vistas remotamente. No hay nada intrínsecamente humano en tal percepción. Se ha demostrado que esta multitarea desvía la atención y el rendimiento humanos. Las IA tienen la capacidad de manejar tales datos. Para fines de seguridad, al interactuar con cámaras de video, funcionalmente tienen una mejor agudeza visual que los humanos o la aproximación de la máquina a la misma. Para juzgar las sutilezas de los comportamientos o intenciones de los sujetos o los grados de amenaza, los humanos siguen siendo muy superiores en el estado actual de la tecnología. Así pues, la IA en seguridad funciona para realizar un escaneo amplio que va más allá de la capacidad humana y para examinar los datos hasta un primer nivel de clasificación por relevancia, alertando al agente humano, quien entonces asume la función de evaluación y respuesta.

En el mundo práctico, la seguridad se determina económicamente, de modo que el gasto en seguridad preventiva rara vez supera el costo percibido del riesgo a evitar. Los estudios han demostrado que las empresas suelen gastar solo una veinticincoava parte de lo que les cuestan sus pérdidas reales en seguridad. [ 12 ] Lo que, según la teoría económica pura, debería ser una equivalencia u homeostasis, dista mucho de serlo. Una teoría que explica esto es la disonancia cognitiva , o la facilidad con la que se pueden apartar de la mente consciente cosas desagradables como el riesgo. Sin embargo, la seguridad representa un gasto importante, y la comparación de los costos de los diferentes medios de seguridad es siempre una prioridad para los profesionales de la seguridad.

Otra razón por la que las futuras amenazas o pérdidas de seguridad se subestiman es que, a menudo, solo se considera el costo directo de una posible pérdida, en lugar del conjunto de pérdidas consecuentes que se experimentan simultáneamente. Por ejemplo, la destrucción por vandalismo de una máquina de producción especializada en una fábrica o de un camión frigorífico resultaría en un largo período de reemplazo durante el cual no se podría atender a los clientes, lo que provocaría la pérdida de sus negocios. Un delito violento tendrá un gran daño a la imagen pública de un empleador, más allá de la responsabilidad directa por no proteger al empleado.

El análisis del comportamiento funciona de manera única más allá de la simple seguridad y, debido a su capacidad para observar infracciones en patrones estándar de protocolos, puede encontrar eficazmente actos inseguros de los empleados que pueden resultar en incidentes de compensación laboral o responsabilidad civil. Aquí también, la evaluación de los costos de incidentes futuros no se ajusta a la realidad. Un estudio de Liberty Mutual Insurance Company mostró que el costo para los empleadores es aproximadamente seis veces el costo directo asegurado, ya que los costos no asegurados de daños consecuenciales incluyen trabajadores de reemplazo temporal, costos de contratación para reemplazos, costos de capacitación, tiempo de los gerentes en informes o tribunales, moral negativa en otros trabajadores y efecto en los clientes y las relaciones públicas. [ 13 ] El potencial de la IA en forma de análisis del comportamiento para interceptar y prevenir proactivamente tales incidentes es significativo.

Véase también

Referencias

  1. Sasithradevi, A.; Roomi, S. Mohamed Mansoor; Sivaranjani, R. (2021). "Red generativa antagónica para análisis de vídeo". Redes generativas antagónicas para la traducción de imagen a imagen . págs. 329–345 . doi : 10.1016/B978-0-12-823519-5.00008-7 . ISBN  978-0-12-823519-5.
  2. Green, Mary W. (septiembre de 1999). El uso apropiado y eficaz de las tecnologías de seguridad en las escuelas de EE. UU. Una guía para escuelas y organismos encargados de hacer cumplir la ley (Informe). ERIC ED436943 NCJ 178265 .  
  3. Sulman, Noah; Sanocki, Thomas; Goldgof, Dmitry; Kasturi, Rangachar (2008). "¿Qué tan efectivo es el desempeño de la videovigilancia humana?". 19.ª Conferencia Internacional sobre Reconocimiento de Patrones de 2008. págs. 1-3 . doi : 10.1109/ICPR.2008.4761655 . ISBN  978-1-4244-2174-9.
  4. Nuechterlein, Keith H.; Parasuraman, Raja; Jiang, Qiyuan (15 de abril de 1983). "Atención visual sostenida: la degradación de la imagen produce una rápida disminución de la sensibilidad con el tiempo". Science . 220 (4594): 327– 329. Bibcode : 1983Sci...220..327N . doi : 10.1126/science.6836276 . PMID 6836276 . 
  5. ^ Srivastava, Shubhanshu; Patodi, Srishti; Tamrakar, Varun; Wadikar, Uttara (2019). "Optimización de cámaras de vigilancia mediante Matlab e IA" . Revista internacional de investigaciones y reseñas de ingeniería . 7 (2): 8-10 .
  6. Domingos, Pedro (2015). El algoritmo maestro: Cómo la búsqueda de la máquina de aprendizaje definitiva transformará nuestro mundo . Basic Books. ISBN 978-0-465-06192-1.
  7. Davies, ER (2012). Visión por computadora y visión artificial: teoría, algoritmos y aspectos prácticos . Academic Press. ISBN 978-0-12-386991-3.
  8. Dufour, Jean-Yves, ed. (2012). Sistemas inteligentes de videovigilancia . doi : 10.1002/9781118577851 . ISBN 978-1-84821-433-0.
  9. Hantman, Ken (2014) ¿Qué es el análisis de vídeo? Explicado de forma sencilla.
  10. Rice, Derek, Finding & Selling The Value of Analytics , SDM Magazine (septiembre de 2015) BNP Media II, Troy, Michigan
  11. "La evolución del análisis de vídeo" . Security Sales & Integration . 11 de agosto de 2012.
  12. Bressler, Martin S (2009). "El impacto del crimen en los negocios: un modelo para la prevención, detección y remediación". Journal of Management and Marketing Research .
  13. Informe del Índice de Seguridad , Liberty Mutual Insurance Company (2002)