Mistral发布Voxtral,开放语音模型从转写走向理解与执行
7月15日,Mistral AI发布Voxtral系列语音理解模型,包括面向生产应用的240亿参数版本和适合本地、边缘部署的30亿参数版本。两款模型均采用Apache 2.0许可证开放,并可通过API使用。
Voxtral不仅用于语音转写,还支持直接围绕音频进行问答、总结和信息分析。模型提供3.2万Token上下文,可处理较长音频,并支持多语言识别以及根据语音意图触发函数和业务流程。
传统语音应用通常需要先完成语音转文字,再交由语言模型处理。Voxtral尝试将识别、理解和任务调用整合在同一链路中,可用于会议整理、客服分析、语音助手和视频内容处理。
语音数据往往包含客户隐私、内部讨论和口头承诺。企业使用时应同步建立录音授权、数据保存、敏感信息处理和人工复核机制,并使用真实噪声、口音和行业术语进行测试。