MultimodalCross-modal capabilities: image, video and speech
跨模态
Aligning and transferring information across modalities such as text, image and audio.
Cross-modal ability lets models grasp relations like text-in-images and image-text matching; unifying representation spaces is the core design idea of multimodal models (CLIP being a landmark).