En visuell språkmodell klarer i praksis å analysere rundt 150 bilder per video, og hvilke bilder som velges avgjør om modellen faktisk «ser» videoen eller bare en lysbildeserie av den.

Kilde: https://leoaido.com/how-llms-watch-video/