OpenCompass司南 - 评测榜单

OpenCompass司南 - 评测榜单

评测榜单旨在为大语言模型和多模态模型提供全面、客观且中立的得分与排名,同时提供多能力维度的评分参考,以便用户能够更全面地了解大模型的能力水平。

访问网站
AI模型评测135 次访问更新于 a month ago反馈
OpenCompass司南 - 评测榜单 screenshot

详细介绍

OpenCompass司南 - 评测榜单

简介

OpenCompass(司南)是专注于人工智能大模型评测的权威开放平台。其大语言模型官方自建榜单基于 OpenCompass 2.0 架构打造,按月定期更新,旨在通过标准化、透明化的评测体系,为学术界、工业界及开发者提供客观可靠的模型能力对比基准。

核心评测维度

榜单采用多维度量化评估体系,全面考察大语言模型的综合实力,具体包含以下核心指标:

  • 综合评分:各维度能力的加权均分,作为模型排名的核心依据。
  • 语言:评估模型的基础语言理解、流畅度与生成水平。
  • 知识:考察模型在广泛领域的事实性知识储备与调用能力。
  • 推理:测试模型在逻辑推导、复杂问题拆解与解决方面的表现。
  • 数学:专注模型在数学计算、公式推导与数理逻辑上的准确性。
  • 代码:评估模型在代码生成、理解、调试及工程实践中的水平。
  • 智能体:考察模型在自主规划、工具调用及多步任务执行(Agent)方面的表现。

主要功能

  • 官方月度排行榜:提供基于官方闭源评测集的大模型排名,详细展示各模型的综合得分、发布日期、所属厂商、开源/闭源属性及参数量。
  • 榜单规则与维度说明:公开评分标准、能力维度定义及月度更新机制(平台已对能力维度进行迭代优化)。
  • 评测工具与使用指南:提供配套的评测工具操作指南,支持用户规范进行模型性能测试。
  • 评测生态共建:设有“浦江科学评测共创计划”、年度评测集评选及评测集贡献通道,鼓励社区共同完善评测数据集。
  • 全栈评测导航:除大模型评测外,平台同步提供科学智能评测、具身智能评测、安全评测、AI 计算系统评测及垂类领域评测等细分赛道入口。

适用场景

  • 学术研究与论文撰写:为研究人员提供权威的基准数据支撑,助力算法优化与模型对比分析。
  • 企业/开发者技术选型:帮助技术团队根据参数量规模、开源协议及专项能力(如代码、推理、智能体)快速筛选适配业务的大模型。
  • 行业分析与媒体发布:为科技媒体、自媒体及行业报告提供经过严格验证的模型性能数据与排名依据。
  • 技术趋势追踪:通过月度更新榜单,直观观察国内外头部 AI 厂商的技术迭代路径与能力演进趋势。

使用与引用须知

  • 本榜单数据已全面升级至 OpenCompass 2.0 版本,原 OpenCompass 1.0 开源评测集榜单因内容升级已正式下架。
  • 若您在学术论文、新闻稿件或自媒体文章中引用本榜单数据,请务必规范注明数据来源于司南官网平台:https://opencompass.org.cn