为开发者和企业提供长短语音识别、实时语音转写、语音内容审核、会议超级本等产品服务
依图语音开放平台主要提供短语音识别、长语音识别、实时语音转写、语音内容审核、会议超级本等产品服务
对长段音频流做实时识别,达到“边说边出文字”的效果,适用于实时会议、直播字幕等场景
让你的产品能听会说
把小米在人工智能领域的技术积累对外输出,我们提供多种能力给开发者,帮助开发者实现更多可能
将60秒以内的语音精准识别为文字,可适用于手机语音输入、智能语音交互、语音指令、语音搜索等短语音交互场景
免费为开发者提供语音合成(TTS)、语音识别(ASR)、手写识别(HWR)、光学字符识别(OCR)、语义理解(NLU)、机器翻译(MT)等全方位智能人机交互能力
将短音频(≤60秒)精准识别成文字,除中文普通话和英文外,支持51个语种、24种方言和1个民族语言,实时返回结果,达到边说边返回的效果,可提供公有云接口及私有化部署方案。