多模态图像、视频、语音等跨模态能力
视觉语言模型(VLM)
结合视觉编码器与语言模型的图像理解模型。
视觉语言模型(VLM)把图像转为视觉 Token 后交给语言模型,可完成图像描述、图表解读、截图分析等任务。GPT Image、Gemini 系列与 Qwen-VL 等均属此类。
结合视觉编码器与语言模型的图像理解模型。
视觉语言模型(VLM)把图像转为视觉 Token 后交给语言模型,可完成图像描述、图表解读、截图分析等任务。GPT Image、Gemini 系列与 Qwen-VL 等均属此类。