Изследователи от компанията Microsoft и Университета на Централен Китай нов високопроизводителен метод за проследяване на множество обекти във видео, използващ технологии за машинно обучение — FairMOT (Fair Multi-Object Tracking). Кодът за реализация на метода, основаващ се на Pytorch, и обучените модели може да бъде намерен на GitHub.
Повечето съществуващи методи за проследяване на обекти използват два етапа, всеки от които се реализира от отделна невронна мрежа. В първия етап се извършва модел за определяне на местоположението на интересуващите обекти, а във втория етап се използва модел за търсене на асоциации, прилаган за повторна идентификация на обекти и свързване с тях на якорите.
При FairMOT се използва едностепенна реализация, базирана на деформираща се свиваща невронна мрежа (, Deformable Convolutional Network), която осигурява значително повишаване на скоростта на проследяване на обекти. FairMOT работи без свързване на якори, използвайки механизъм за повторна идентификация за определяне на отклоненията в центровете на обектите на висока прецизна карта на обектите. Паралелно се извършва обработка, оценяваща индивидуалните черти на обектите, които могат да се използват за предсказване на тяхната идентичност, а основният модул извършва свързване на посочените черти за манипулации с обекти от различен мащаб.

За обучението на модела в FairMOT се използва комбинация от шест публично достъпни набора от данни за откриване и търсене на хора (ETH, CityPerson, CalTech, MOT17, CUHK-SYSU). Моделът е тестван с помощта на проверочни подборки видео , , и , предоставени от проекта и обхващащи различни ситуации, движение или завъртане на камерата, различни ъгли на гледане. Проведеното тестване показа, че
FairMOT най-бързите конкурентни модели и при тестване на видеопотокове с честота 30 кадъра в секунда, демонстрирайки производителност, достатъчна за анализ на обикновени видеопотози в реално време.
Източник: opennet.ru
