AILabox
校对于
2026-08-08
EN
◐
☰
AI 工具
术语库
套餐订阅
数据源
AI 术语库
/
语音识别(STT)
多模态
图像、视频、语音等跨模态能力
语音识别(STT)
将语音转换为文本的技术,用于转写、字幕与语音输入。
语音识别用于会议转写、字幕与语音输入,主流方案已支持实时流式识别与多说话人区分,按音频时长计费。
相关术语
语音合成(TTS)
多模态模型