En visuell språkmodell klarer i praksis å analysere rundt 150 bilder per video, og hvilke bilder som velges avgjør om modellen faktisk «ser» videoen eller bare en lysbildeserie av den.
En visuell språkmodell klarer i praksis å analysere rundt 150 bilder per video, og hvilke bilder som velges avgjør om modellen faktisk «ser» videoen eller bare en lysbildeserie av den.