Spirit LM : 多模态语言模型，融合文本和语音

Spirit LM

AI模型模型训练与部署 #多模态 #语言模型 #语音识别 #文本处理 #人工智能普通产品开源

简介 :

Spirit LM是一个基础多模态语言模型，能够自由混合文本和语音。该模型基于一个7B预训练的文本语言模型，通过持续在文本和语音单元上训练来扩展到语音模式。语音和文本序列被串联为单个令牌流，并使用一个小的自动策划的语音-文本平行语料库，采用词级交错方法进行训练。Spirit LM有两个版本：基础版使用语音音素单元（HuBERT），而表达版除了音素单元外，还使用音高和风格单元来模拟表达性。对于两个版本，文本都使用子词BPE令牌进行编码。该模型不仅展现了文本模型的语义能力，还展现了语音模型的表达能力。此外，我们展示了Spirit LM能够在少量样本的情况下跨模态学习新任务（例如ASR、TTS、语音分类）。

需求人群 :

Spirit LM的目标受众是自然语言处理（NLP）领域的研究人员和开发者，特别是那些对多模态语言模型感兴趣的人。该产品适合他们，因为它提供了一个强大的工具来处理和理解混合了文本和语音的数据，这对于开发更自然、更直观的人机交互系统至关重要。此外，它还能帮助研究人员在少量样本的情况下快速训练和部署新的任务模型，从而加速研究和开发进程。

总访问量： 218

占比最多地区： US(82.35%)

本站浏览量： 52.7K

使用场景

例1: 使用Spirit LM基础版对一段语音输入进行自动语音识别（ASR），并生成对应的文本输出。

例2: 利用Spirit LM表达版分析一段语音的情绪和风格，并在文本生成中复现相同的情感表达。

例3: 在教育领域，使用Spirit LM来开发一个辅助语言学习的应用，该应用能够理解和回应学生的语音输入，同时提供文本反馈。

产品特色

• 多模态处理：模型能够处理文本和语音两种模态的数据。

• 词级交错训练：使用小规模的语音-文本平行语料库进行训练，实现词级交错。

• 两个版本：提供基础版和表达版，后者增加了音高和风格单元以模拟表达性。

• 子词BPE编码：文本使用子词BPE令牌进行编码，提高了模型的灵活性和准确性。