How multimodal LLMs work: ViT image patches, CLIP contrastive training, connectors like MLP projectors and Q-Former, tiling, audio, video and VLM training.