MultimodalCross-modal capabilities: image, video and speech
多模态模型
Models that process multiple modalities—text, image, audio—as input or output.
Multimodal models fuse vision/audio encoders with language models, supporting image Q&A, mixed understanding and voice interaction. Flagships like GPT-5, Gemini and Claude natively accept images.