AILabox
校对于
2026-08-08
EN
◐
☰
AI 工具
术语库
套餐订阅
数据源
AI 术语库
/
图像理解
多模态
图像、视频、语音等跨模态能力
图像理解
模型识别并解释图像内容的能力。
图像理解涵盖物体识别、场景描述、图表解析、文档 OCR 等,是多模态模型的核心输入能力,广泛用于自动标注、内容审核与无障碍辅助。
相关术语
视觉语言模型(VLM)
OCR(光学字符识别)
多模态模型