上海人工智能实验室开源的大语言模型评测框架
OpenCompass 是由上海人工智能实验室(Shanghai AI Laboratory)联合多所高校推出的开源大语言模型评测框架。它旨在为大语言模型提供标准化、自动化、全面的能力评估,支持多种评测数据集和模型接口。
该平台支持包括 MMLU、GSM8K、HumanEval 等在内的近百种权威评测基准,覆盖知识理解、逻辑推理、代码生成、长文本理解等多个维度,为模型能力的对比与迭代提供客观参考标准。
支持 OpenAI API、HuggingFace、本地模型等多种接口,适配主流大语言模型
内置近百种权威评测基准,覆盖知识、推理、代码、语言等多个维度
一键启动评测任务,自动调度、并行处理、结果汇总,全流程自动化
自动生成多维度评测报告,支持横向对比、趋势分析、详细数据查看
支持自定义数据集、评测指标、提示词模板,满足个性化评测需求
活跃的开源社区,持续更新维护,众多企业和研究机构共同贡献
| 评测框架 | OpenCompass v1.2.0 |
| 部署方式 | Docker 容器化 |
| 操作系统 | Linux 5.10 (x86_64) |
| 硬件资源 | CPU, 3.5GB 内存 |
| 并发数 | 1 (单进程顺序执行) |
| 推理模式 | Zero-shot (无示例) |
| Temperature | 0.001 (低随机性) |
| Max Tokens | 8192 |
| 重试次数 | 3 次 |
| API 平台 | YH Platform |
MMLU (Massive Multitask Language Understanding) 是由加州大学伯克利分校等机构推出的权威评测基准,包含 57 个学科领域的选择题,涵盖科学、人文、数学、工程等多个领域,是业界公认的知识理解和推理能力评测标准。
| # | 学科名称 | 中文名称 | 测试集 | 验证集 | 开发集 | 完整总数 |
|---|---|---|---|---|---|---|
| 合计 | 14,042 | 1,531 | 285 | 15,858 | ||
数据来源:HuggingFace cais/mmlu · 本次评测使用全部 57 个学科共 14,042 道测试题
采用 Zero-shot(零样本)模式,不提供任何示例题目。模型需要直接理解题目并作答,测试其真实知识储备和推理能力。
使用统一的提示词模板,确保所有模型在相同条件下作答:
使用 AccEvaluator 评估器,从模型输出中提取最终答案(A/B/C/D),与标准答案对比计算准确率。支持从推理过程中智能提取答案。