Qwen2-Audio官网,阿里通義千問開源音频语言大模型
简介
Qwen2-Audio 是由阿里通義千問團队最新推出的開源AI语音模型,具備直接语音输入和多语言文本输出的能力。它支持语音聊天和音频分析两种模式,并且能够理解包括中文、英语、粤语、法语、意大利语、西班牙语、德语和日语在内的超过8种语言和方言。Qwen2-Audio 在多个基准資料集上表现優異,现已集成至Hugging Face的transformers库,方便開發者使用,并且支持透過ms-swift框架进行微调,以适应特定应用場景 。
Qwen2-Audio官网:
github專案源碼链接:
https://github.com/QwenLM/Qwen2-Audio
huggingface在线試用链接:
https://huggingface.co/spaces/Qwen/Qwen2-Audio-Instruct-Demo
arxiv論文地址:https://arxiv.org/abs/2407.10759

Qwen2-Audio 是由阿里通義推出的一款大規模音频语言模型。该專案包含两种音频交互模式:语音聊天和音频分析。用户可以透過语音与Qwen2-Audio进行交互,或者提供音频及文本指令进行分析。该專案还公開了两个模型:Qwen2-Audio-7B 和 Qwen2-Audio-7B-Instruct,它们都支持在不同的音频處理任務上进行操作。
主要功能和特色
Qwen2-Audio 的主要特点包括:
– 语音聊天:用户可以直接用语音与模型交流,無需透過自动语音辨識(ASR)轉换。
– 音频分析:能够根据文本指令分析音频内容,辨識语音、声音和音樂等。
– 多语言支持:支持中文、英语、粤语、法语等多种语言和方言。
– 高性能:在多个基准資料集上超越先前模型,表现出色。
– 易于集成:代碼已集成到Hugging Face的transformers库,方便開發者使用和推理。
– 可微调性:支持透過ms-swift框架进行模型微调,适应不同应用需求 。
Qwen2-Audio 的技術原理涵蓋了多模態输入處理、预訓练与微调、注意力机制、条件文本生成、编碼器-解碼器架构、Transformer架构以及優化算法,这些技術的結合使得Qwen2-Audio能够有效地處理和生成文本 。
此外,Qwen2-Audio 的模型效果在一系列基准資料集上进行了测試,包括 LibriSpeech、Common Voice 15、Fleurs、Aishell2、CoVoST2、Meld、Vocalsound 以及 AIR-Benchmark,测試結果顯示 Qwen2-Audio 超越了先前的最佳模型 。Qwen2-Audio 已經被 Hugging Face Transfomers 官方支持,用户可以透過源碼安装 `transformers` 进行使用 。
在不久的將来,Qwen2-Audio團队计劃在更大的预訓练資料集上訓练出更優秀的 Qwen2-Audio 模型,使该模型能够支持更长的音频(超过30秒),并且他们还將构建更大規模的 Qwen2-Audio 模型,用于研究音频语言模型的擴展定律 。
Qwen2-Audio 具備下面的几个特点:
-
语音聊天:用户可以使用语音向音频语言模型發出指令,無需透過自动语音辨識(ASR)模块。
-
音频分析:该模型能够根据文本指令分析音频信息,包括语音、声音、音樂等。
- 多语言支持:该模型支持超过8种语言和方言,例如中文、英语、粤语、法语、意大利语、西班牙语、德语和日语。
模型效果
官方在一系列基准資料集上进行了實验,包括 LibriSpeech、Common Voice 15、Fleurs、Aishell2、CoVoST2、Meld、Vocalsound 以及 AIR-Benchmark,下面我们將展示一張圖表来說明 Qwen2-Audio 相對于竞争對手的表现。在所有任務中,Qwen2-Audio 都顯著超越了先前的最佳模型或是 Qwen-Audio。

結构与訓练范式
下圖展示了模型結构及訓练方法。具体来說,通義千問團队使用 Qwen 语言模型和音频编碼器这两个基礎模型,接着依次进行多任務预訓练以實现音频与语言的對齊,以及 SFT 和 DPO 来掌握下遊任務的能力并捕捉人类的偏好。

整体表现
