Llama Omni : 低延迟、高质量的端到端语音交互模型

Llama Omni

简介 :

LLaMA-Omni是一个基于Llama-3.1-8B-Instruct构建的低延迟、高质量的端到端语音交互模型，旨在实现GPT-4o级别的语音能力。该模型支持低延迟的语音交互，能够同时生成文本和语音响应。它在不到3天的时间内使用仅4个GPU完成训练，展示了其高效的训练能力。

需求人群 :

LLaMA-Omni模型适合语音识别、语音合成和自然语言处理领域的研究人员和开发者。它可以帮助他们构建低延迟、高质量的语音交互系统，推动智能语音助手和相关应用的发展。

总访问量： 474.6M

占比最多地区： US(19.34%)

本站浏览量： 65.7K

使用场景

用于开发智能语音助手，提供流畅的语音对话体验。

集成到智能家居系统中，实现语音控制家居设备。

应用于客服机器人，提供快速准确的语音服务。

产品特色

基于Llama-3.1-8B-Instruct构建，确保高质量响应。

低延迟语音交互，延迟低至226毫秒。

同时生成文本和语音响应。

在不到3天的时间内使用4个GPU完成训练。

支持Gradio演示，方便用户交互体验。

提供本地推理脚本，方便用户进行本地测试。

使用教程

克隆LLaMA-Omni仓库到本地。

进入LLaMA-Omni目录并安装所需的包。

安装fairseq和flash-attention。

下载Llama-3.1-8B-Omni模型和Whisper-large-v3模型。

下载基于单元的HiFi-GAN声码器。

启动Gradio演示，访问本地服务器进行交互。

对于本地推理，按照omni_speech/infer/examples目录中的格式组织语音指令文件，然后参考提供的脚本进行操作。

精选AI产品推荐

智启未来，您的人工智能解决方案智库

直接访问	51.61%	外链引荐	33.46%	邮件	0.04%
自然搜索	12.58%	社交媒体	2.19%	展示广告	0.11%