MultimodalCross-modal capabilities: image, video and speech

多模态模型

Models that process multiple modalities—text, image, audio—as input or output.

Multimodal models fuse vision/audio encoders with language models, supporting image Q&A, mixed understanding and voice interaction. Flagships like GPT-5, Gemini and Claude natively accept images.

Related terms