昨天,基准测试平台Chatbot Arena公布最新大模型盲测榜单,10天前发布的阿里通义千问开源模型Qwen2.5再次闯入前十。
- 大语言模型Qwen2.5-72B-Instruct排名LLM榜单第十,是前十唯一的中国大模型;
- Qwen系列视觉语言模型Qwen2-VL-72B-Instruct排名Vision榜单第九,是得分最高的开源大模型。
Qwen2.5-72B-Instruct排名Chatbot Arena大语言模型榜单第十
Chatbot Arena是由开放研究机构LMSYS Org推出的大模型性能测试平台,目前集成了全球70多个大模型,采用匿名方式将大模型两两组队,交给用户进行盲测,用户根据真实对话体验对模型能力进行投票。
9月19日发布的Qwen系列模型再度进榜,Qwen2.5-72B-Instruct得分位列LLM榜单第十,居于OpenAI的o1、GPT-4o等模型之后;同天开源的视觉语言模型Qwen2-VL-72B-Instruct闯入Vision榜单第九,略逊于GPT-4o、Gemini-1.5-Pro等闭源模型。在这以前,Qwen系列已有多款模型被该榜单收录。
Chatbot Arena官方发文,Qwen2-VL-72B-Instruct是排名最高的开源视觉语言模型
同一时间,开源社区基于Qwen系列二次开发的衍生模型数量突破7.43万,首次超越Llama系列衍生模型(7.28万),Qwen成了规模最大的生成式语言模型族群。
在Hugging Face最新的开源模型权威榜单Open LLM Leaderboard上,Qwen及其衍生模型包揽了前十全部座次。
Qwen及其衍生模型包揽Open LLM Leaderboard榜单前十
不论是在模型性能还是在模型生态方面,通义千问开源系列都在持续发展。目前,Qwen的开源谱系涵盖多个尺寸的大语言模型、多模态模型、数学模型和代码模型,尤其是Qwen2.5,几乎所有尺寸模型都实现了同等规模业界最佳性能。Qwen2.5收到了社区的广泛关注和积极反馈,发布10天下载量已经超过150万。