MultimodalCross-modal capabilities: image, video and speech

跨模态

Aligning and transferring information across modalities such as text, image and audio.

Cross-modal ability lets models grasp relations like text-in-images and image-text matching; unifying representation spaces is the core design idea of multimodal models (CLIP being a landmark).

Related terms