什么是 OpenCompass?

上海人工智能实验室开源的大语言模型评测框架

框架简介

OpenCompass 是由上海人工智能实验室(Shanghai AI Laboratory)联合多所高校推出的开源大语言模型评测框架。它旨在为大语言模型提供标准化、自动化、全面的能力评估,支持多种评测数据集和模型接口。

该平台支持包括 MMLU、GSM8K、HumanEval 等在内的近百种权威评测基准,覆盖知识理解、逻辑推理、代码生成、长文本理解等多个维度,为模型能力的对比与迭代提供客观参考标准。

多模型支持

支持 OpenAI API、HuggingFace、本地模型等多种接口,适配主流大语言模型

丰富数据集

内置近百种权威评测基准,覆盖知识、推理、代码、语言等多个维度

自动化评测

一键启动评测任务,自动调度、并行处理、结果汇总,全流程自动化

可视化报告

自动生成多维度评测报告,支持横向对比、趋势分析、详细数据查看

灵活扩展

支持自定义数据集、评测指标、提示词模板,满足个性化评测需求

开源社区

活跃的开源社区,持续更新维护,众多企业和研究机构共同贡献

本次评测配置

环境配置

评测框架 OpenCompass v1.2.0
部署方式 Docker 容器化
操作系统 Linux 5.10 (x86_64)
硬件资源 CPU, 3.5GB 内存
并发数 1 (单进程顺序执行)

评测参数

推理模式 Zero-shot (无示例)
Temperature 0.001 (低随机性)
Max Tokens 8192
重试次数 3 次
API 平台 YH Platform

评测数据集介绍

MMLU - 大规模多任务语言理解

MMLU (Massive Multitask Language Understanding) 是由加州大学伯克利分校等机构推出的权威评测基准,包含 57 个学科领域的选择题,涵盖科学、人文、数学、工程等多个领域,是业界公认的知识理解和推理能力评测标准。

57
学科领域
选择题
题目格式
A/B/C/D
选项数量
57
本次测试子集

MMLU 全部 57 个学科子集

评测方法

1

Zero-shot 推理

采用 Zero-shot(零样本)模式,不提供任何示例题目。模型需要直接理解题目并作答,测试其真实知识储备和推理能力。

2

提示词模板

使用统一的提示词模板,确保所有模型在相同条件下作答:

There is a single choice question. Answer the question by replying A, B, C or D. Q: {题目内容} A. {选项A} B. {选项B} C. {选项C} D. {选项D} Let's think step by step. A:
3

准确率评估

使用 AccEvaluator 评估器,从模型输出中提取最终答案(A/B/C/D),与标准答案对比计算准确率。支持从推理过程中智能提取答案。