司南 CompassRank 评测 —— 上海人工智能实验室开发的 OpenCompass 大模型评测体系

3.23 该榜单通过多维度的评测基准,覆盖语言推理知识代码数学指令跟随智能体等多个能力维度,成为学术界和产业界广泛认可的评测工具之一

司南 CompassRank 评测榜是由上海人工智能实验室开发的 OpenCompass 大模型评测体系的核心组成部分,旨在为全球大语言模型(LLM)提供全面、公正、透明的性能评估和排名。该榜单通过多维度的评测基准,覆盖语言、推理、知识、代码、数学、指令跟随、智能体等多个能力维度,成为学术界和产业界广泛认可的评测工具之一。

 

1. CompassRank 的背景与目标

CompassRank 是 OpenCompass 评测体系的核心模块之一,旨在解决大模型评测中的“刷榜”乱象,提供真实、可靠的模型性能评估。通过公开评测基准和动态更新的题目,CompassRank 避免了模型通过“题海战术”提高分数的现象,确保评测结果能够真实反映模型的实际能力。

 

2. 评测维度与方法

CompassRank 的评测涵盖多个能力维度,具体包括:

语言能力:评估模型在自然语言处理任务中的表现,如文本生成、翻译等。

推理能力:测试模型在逻辑推理、数学计算等复杂任务中的表现。

知识能力:评估模型对常识、专业知识的掌握程度。

代码能力:测试模型在编程任务中的表现,如代码生成、算法实现等。

数学能力:评估模型在数值计算、高等数学等任务中的表现。

指令跟随:测试模型在遵循复杂指令方面的能力。

智能体能力:评估模型在工具调用、任务规划等智能体任务中的表现。

 

评测方法包括客观评测(如代码生成、数学计算)和主观评测(如指令跟随、对话生成),并通过加权计算得出总分。

 

3. 评测特点

开源可复现:CompassRank 提供公开的评测基准和工具链,确保评测过程透明且可复现。

动态更新:评测题目定期更新,避免模型通过“刷题”提高分数,确保评测结果的真实性和时效性。

多维度评估:通过细分任务和加权评分,CompassRank 能够全面反映模型的综合能力。

广泛支持:支持国内外主流闭源模型和开源模型,涵盖 API 模型和本地部署模型。

 

4. 影响力与参与模型

CompassRank 已成为全球大模型评测的重要参考,吸引了 OpenAI、Meta、阿里巴巴、百度等顶尖企业和研究机构的参与。例如,GPT-4 Turbo、智谱清言 GLM-4、阿里 Qwen-Max 等模型均在榜单中名列前茅。

 

5. 未来发展方向

CompassRank 计划进一步扩展评测范围,包括更多垂直领域(如法律、金融、医疗)的评测基准,并与行业头部企业合作,构建高质量的行业评测数据集。

 

OpenCompass榜单:

https://rank.opencompass.org.cn/home 

OpenCompass官网:
https://opencompass.org.cn/