AN IMAGE IS WORTH 16x16 WORDS:
TRANSFORMERS FOR IMAGE RECOGNITION AT SCALE
Vision Transformer (ViT)
Transformer Encoder
purple arrow
AI text/layout recreation from video frame; verify against source image.