OpenCompass 是上海人工智能实验室推出的开源大模型评测体系,支持多维度、标准化模型评估。...
CMMLU 是面向中文大模型的综合性评估基准,涵盖多领域知识与能力评测。...
MMBench 是面向多模态大模型的综合性评测体系,涵盖视觉、语言与跨模态理解能力。...
斯坦福大学推出的开源大模型评测体系,聚焦多维度、可复现的AI模型评估。...
LMArena 是一个专注于AI模型多维度评测的公开平台,支持用户对比测试主流大模型性能。...