多模态图像、视频、语音等跨模态能力

视觉语言模型(VLM)

结合视觉编码器与语言模型的图像理解模型。

视觉语言模型(VLM)把图像转为视觉 Token 后交给语言模型,可完成图像描述、图表解读、截图分析等任务。GPT Image、Gemini 系列与 Qwen-VL 等均属此类。

相关术语