Визуально-языковая система «Безопасный город»
Визуально-языковая модель для мониторинга городской безопасности: она описывает, что происходит в кадре, а не только находит в нём объекты.
Задача
Классическая детекция сообщает оператору, что на экране появилась коробка. Она не скажет, что эта коробка делает, а комната операторов не в состоянии смотреть все камеры сразу. Безопасному городу нужна система, которая понимает сцену достаточно, чтобы описать событие, заслуживающее внимания человека.
Наш подход
Понимать сцены, а не объекты
Визуально-языковой подход: система выдаёт описание события, а не только метку класса.
Работать там, где стоят камеры
Инференс рассчитан на on-premise-оборудование, чтобы видео не покидало сеть оператора.
Ранжировать для оператора
Результат — короткий список событий, на которые стоит посмотреть, с приложенной причиной.
Скриншоты развёрнутого интерфейса не публикуются: внедрение закрыто NDA с партнёром.