FMV Grounding
Vision-Language Detection for Full-Motion Video
FMV Grounding is a closed-set vision-language object detection model that localizes six land and maritime object classes across satellite, aerial, drone, and ground imagery, reaching 71.55% mAP on an internal 700K-annotation benchmark